Skip to main content
De Olostep LangChain-integratie biedt uitgebreide tools om AI-agenten te bouwen die data van elke website kunnen zoeken, scrapen, analyseren en structureren. Perfect voor LangChain en LangGraph toepassingen.

Functies

De integratie biedt toegang tot alle 5 Olostep API-mogelijkheden:

Scrapes

Haal inhoud op van elke enkele URL in meerdere formaten (Markdown, HTML, JSON, tekst)

Batches

Verwerk tot 10.000 URL’s parallel. Batchtaken worden voltooid in 5-8 minuten

Answers

AI-gestuurde webzoekopdrachten met natuurlijke taalvragen en gestructureerde output

Maps

Haal alle URL’s van een website op voor analyse van de sitestructuur

Crawls

Ontdek en scrape autonoom volledige websites door links te volgen

Installatie

Setup

Stel je Olostep API-sleutel in als een omgevingsvariabele:
Verkrijg je API-sleutel van het Olostep Dashboard.

Beschikbare Tools

scrape_website

Haal inhoud op van een enkele URL. Ondersteunt meerdere formaten en JavaScript-rendering.
string
vereist
Website-URL om te scrapen (moet http:// of https:// bevatten)
string
standaard:"markdown"
Uitvoerformaat: markdown, html, json, of text
string
Landcode voor locatie-specifieke inhoud (bijv. “US”, “GB”, “CA”)
integer
Wachttijd in milliseconden voor JavaScript-rendering (0-10000)
string
Optionele parser-ID voor gespecialiseerde extractie (bijv. “@olostep/amazon-product”)

scrape_batch

Verwerk meerdere URL’s parallel (tot 10.000 tegelijk).
array
vereist
Lijst van URL’s om te scrapen
string
standaard:"markdown"
Uitvoerformaat voor alle URL’s: markdown, html, json, of text
string
Landcode voor locatie-specifieke inhoud
integer
Wachttijd in milliseconden voor JavaScript-rendering
string
Optionele parser-ID voor gespecialiseerde extractie

answer_question

Zoek op het web en krijg AI-gestuurde antwoorden met bronnen. Perfect voor data verrijking en onderzoek.
string
vereist
Vraag of taak om naar te zoeken
object
Optioneel JSON-schema dict/string dat het gewenste uitvoerformaat beschrijft

extract_urls

Haal alle URL’s van een website op voor analyse van de sitestructuur.
string
vereist
Website-URL om URL’s van op te halen
string
Optionele zoekopdracht om URL’s te filteren
integer
Beperk het aantal geretourneerde URL’s
array
Glob-patronen om op te nemen (bijv. [“/blog/**”])
array
Glob-patronen om uit te sluiten (bijv. [“/admin/**”])

crawl_website

Ontdek en scrape autonoom volledige websites door links te volgen.
string
vereist
Start-URL voor de crawl
integer
standaard:"100"
Maximum aantal pagina’s om te crawlen
array
Glob-patronen om op te nemen (bijv. [”/**”] voor alles)
array
Glob-patronen om uit te sluiten (bijv. [“/admin/**”])
integer
Maximale diepte om te crawlen vanaf start_url
boolean
standaard:"false"
Inclusief externe URL’s

LangChain Agent Integratie

Bouw intelligente agenten die het web kunnen doorzoeken en scrapen:

LangGraph Integratie

Bouw complexe multi-step workflows met LangGraph:

Geavanceerde Gebruiksscenario’s

Data Verrijking

Verrijk spreadsheetgegevens met webinformatie:

E-commerce Product Scraping

Scrape productgegevens met gespecialiseerde parsers:

SEO Audit

Analyseer volledige websites voor SEO:

Documentatie Scraping

Crawl en haal documentatie op:

Gespecialiseerde Parsers

Olostep biedt vooraf gebouwde parsers voor populaire websites:
  • @olostep/google-search - Google zoekresultaten
Gebruik ze met de parser parameter:

Foutafhandeling

Best Practices

Bij het scrapen van meer dan 3-5 URL’s, gebruik scrape_batch in plaats van meerdere scrape_website oproepen. Batchverwerking is veel sneller en kosteneffectiever.
Voor JavaScript-intensieve sites, gebruik de wait_before_scraping parameter (2000-5000ms is typisch). Dit zorgt ervoor dat dynamische inhoud volledig is geladen.
Voor populaire websites (Amazon, LinkedIn, Google), gebruik onze vooraf gebouwde parsers om automatisch gestructureerde data te verkrijgen.
Bij het gebruik van extract_urls of crawl_website, gebruik glob-patronen om je te richten op relevante pagina’s en onnodige verwerking te vermijden.
Implementeer exponentiële backoff voor rate limit fouten. De API behandelt de meeste rate limiting intern automatisch.

Ondersteuning

Gerelateerde Bronnen

Scrapes API

Leer over de Scrapes endpoint

Batches API

Leer over de Batches endpoint

Answers API

Leer over de Answers endpoint

Maps API

Leer over de Maps endpoint

Crawls API

Leer over de Crawls endpoint

Python SDK

Verken de Python SDK

LangChain Website

LangChain platform