Skip to main content

Vue d’ensemble

Au lieu de cartographier l’ensemble du site web, tu pourrais vouloir te concentrer sur des sections spécifiques. Dans ce guide, nous allons te montrer comment extraire uniquement les URL de blog du site web de Stripe.

Extraction des URL de Blog Uniquement

Pour extraire uniquement les URL de blog du site web de Stripe, utilise le point de terminaison maps avec des filtres de modèle de chemin. Le paramètre include_urls te permet de spécifier exactement quels modèles d’URL tu souhaites inclure dans les résultats.

Comprendre les Modèles d’URL

Dans l’exemple ci-dessus, nous utilisons deux spécifications de modèle :
  • /blog - Correspond exactement à la page principale du blog (https://stripe.com/blog)
  • /blog/** - Correspond à tous les sous-chemins sous /blog, y compris les articles de blog individuels, les pages de catégorie, etc.
Cette combinaison garantit que nous capturons tout le contenu lié au blog tout en excluant les autres sections du site web.

Exemple de Réponse

Filtrer les URL de Blog par Catégorie

Tu peux affiner davantage ton extraction pour te concentrer sur des catégories de blog spécifiques. Par exemple, si tu es seulement intéressé par les articles de blog d’ingénierie de Stripe :

Prochaines Étapes

Maintenant que tu as extrait toutes les URL de blog de Stripe,
  1. Tu peux récupérer leur contenu individuellement en utilisant l’API de scraping.
  2. Ou, utilise le guide suivant pour explorer et extraire directement le contenu réel de ces pages de blog avec des filtres intégrés.