Naar hoofdinhoud gaan

Overzicht

In plaats van de hele website in kaart te brengen, wil je je misschien richten op specifieke secties. In deze gids laten we je zien hoe je alleen de blog-URL’s van Stripe’s website kunt extraheren.

Alleen Blog-URL’s Extraheren

Om alleen blog-URL’s van Stripe’s website te extraheren, gebruik je het maps-eindpunt met padpatroonfilters. De parameter include_urls stelt je in staat om precies te specificeren welke URL-patronen je in de resultaten wilt opnemen.

Begrijpen van de URL-patronen

In het bovenstaande voorbeeld gebruiken we twee patroon specificaties:
  • /blog - Komt precies overeen met de hoofdpagina van de blog (https://stripe.com/blog)
  • /blog/** - Komt overeen met alle subpaden onder /blog, inclusief individuele blogposts, categoriepagina’s, enz.
Deze combinatie zorgt ervoor dat we alle bloggerelateerde content vastleggen terwijl we andere secties van de website uitsluiten.

Voorbeeld Reactie

Blog-URL’s Filteren op Categorie

Je kunt je extractie verder verfijnen om je te richten op specifieke blogcategorieën. Bijvoorbeeld, als je alleen geïnteresseerd bent in Stripe’s engineering blogposts:

Volgende Stappen

Nu je alle blog-URL’s van Stripe hebt geëxtraheerd,
  1. Kun je hun inhoud individueel ophalen met behulp van de scrape API.
  2. Of, gebruik de volgende gids om de daadwerkelijke inhoud van deze blogpagina’s direct te crawlen en extraheren met ingebouwde filters.