Skip to main content

Overzicht

In plaats van de hele website in kaart te brengen, wil je je misschien richten op specifieke secties. In deze gids laten we je zien hoe je alleen de blog-URL’s van Stripe’s website kunt extraheren.

Alleen Blog-URL’s Extraheren

Om alleen blog-URL’s van Stripe’s website te extraheren, gebruik je de maps endpoint met padpatroonfilters. De parameter include_urls stelt je in staat om precies te specificeren welke URL-patronen je in de resultaten wilt opnemen.

Begrip van de URL-Patronen

In het bovenstaande voorbeeld gebruiken we twee patroon specificaties:
  • /blog - Komt precies overeen met de hoofdpagina van de blog (https://stripe.com/blog)
  • /blog/** - Komt overeen met alle subpaden onder /blog, inclusief individuele blogposts, categoriepagina’s, etc.
Deze combinatie zorgt ervoor dat we alle blog-gerelateerde content vastleggen terwijl andere secties van de website worden uitgesloten.

Voorbeeldreactie

Blog-URL’s Filteren op Categorie

Je kunt je extractie verder verfijnen om je te richten op specifieke blogcategorieën. Bijvoorbeeld, als je alleen geïnteresseerd bent in de engineering blogposts van Stripe:

Volgende Stappen

Nu je alle blog-URL’s van Stripe hebt geëxtraheerd,
  1. Kun je hun inhoud individueel ophalen met behulp van de scrape API.
  2. Of, gebruik de volgende gids om de daadwerkelijke inhoud van deze blogpagina’s direct te crawlen en extraheren met ingebouwde filters.