Skip to main content
Die Olostep LangChain-Integration bietet umfassende Werkzeuge zum Erstellen von KI-Agenten, die Daten von jeder Website suchen, scrapen, analysieren und strukturieren können. Perfekt für LangChain- und LangGraph-Anwendungen.

Funktionen

Die Integration bietet Zugriff auf alle 5 Olostep API-Funktionen:

Scrapes

Inhalte von jeder einzelnen URL in mehreren Formaten extrahieren (Markdown, HTML, JSON, Text)

Batches

Bis zu 10.000 URLs parallel verarbeiten. Batch-Jobs werden in 5-8 Minuten abgeschlossen

Answers

KI-gestützte Websuche mit Anfragen in natürlicher Sprache und strukturiertem Output

Maps

Alle URLs von einer Website für die Analyse der Seitenstruktur extrahieren

Crawls

Autonomes Entdecken und Scrapen ganzer Websites durch Verfolgen von Links

Installation

Einrichtung

Setze deinen Olostep API-Schlüssel als Umgebungsvariable:
Hole dir deinen API-Schlüssel vom Olostep Dashboard.

Verfügbare Werkzeuge

scrape_website

Inhalte von einer einzelnen URL extrahieren. Unterstützt mehrere Formate und JavaScript-Rendering.
string
erforderlich
Website-URL zum Scrapen (muss http:// oder https:// enthalten)
string
Standard:"markdown"
Ausgabeformat: markdown, html, json oder text
string
Ländercode für standortspezifische Inhalte (z.B. “US”, “GB”, “CA”)
integer
Wartezeit in Millisekunden für JavaScript-Rendering (0-10000)
string
Optionaler Parser-ID für spezialisierte Extraktion (z.B. “@olostep/amazon-product”)

scrape_batch

Mehrere URLs parallel verarbeiten (bis zu 10.000 auf einmal).
array
erforderlich
Liste der zu scrapenden URLs
string
Standard:"markdown"
Ausgabeformat für alle URLs: markdown, html, json oder text
string
Ländercode für standortspezifische Inhalte
integer
Wartezeit in Millisekunden für JavaScript-Rendering
string
Optionaler Parser-ID für spezialisierte Extraktion

answer_question

Im Web suchen und KI-gestützte Antworten mit Quellen erhalten. Perfekt für Datenanreicherung und Recherche.
string
erforderlich
Frage oder Aufgabe, nach der gesucht werden soll
object
Optionales JSON-Schema-Diktat/String, das das gewünschte Ausgabeformat beschreibt

extract_urls

Alle URLs von einer Website für die Analyse der Seitenstruktur extrahieren.
string
erforderlich
Website-URL, von der URLs extrahiert werden sollen
string
Optionale Suchanfrage zur Filterung von URLs
integer
Begrenzung der zurückgegebenen URLs
array
Glob-Muster zum Einschließen (z.B. [“/blog/**”])
array
Glob-Muster zum Ausschließen (z.B. [“/admin/**”])

crawl_website

Autonomes Entdecken und Scrapen ganzer Websites durch Verfolgen von Links.
string
erforderlich
Start-URL für den Crawl
integer
Standard:"100"
Maximale Anzahl der zu crawlenden Seiten
array
Glob-Muster zum Einschließen (z.B. [”/**”] für alle)
array
Glob-Muster zum Ausschließen (z.B. [“/admin/**”])
integer
Maximale Tiefe, die von der start_url gecrawlt werden soll
boolean
Standard:"false"
Externe URLs einbeziehen

LangChain-Agenten-Integration

Intelligente Agenten erstellen, die im Web suchen und scrapen können:

LangGraph-Integration

Komplexe mehrstufige Workflows mit LangGraph erstellen:

Erweiterte Anwendungsfälle

Datenanreicherung

Tabellendaten mit Webinformationen anreichern:

E-Commerce-Produktscraping

Produktdaten mit spezialisierten Parsern scrapen:

SEO-Audit

Ganze Websites für SEO analysieren:

Dokumentationsscraping

Dokumentation crawlen und extrahieren:

Spezialisierte Parser

Olostep bietet vorgefertigte Parser für beliebte Websites:
  • @olostep/google-search - Google-Suchergebnisse
Verwende sie mit dem parser-Parameter:

Fehlerbehandlung

Best Practices

Wenn du mehr als 3-5 URLs scrapen möchtest, verwende scrape_batch anstelle mehrerer scrape_website-Aufrufe. Die Batch-Verarbeitung ist viel schneller und kostengünstiger.
Für JavaScript-lastige Seiten verwende den Parameter wait_before_scraping (2000-5000ms ist typisch). Dies stellt sicher, dass dynamische Inhalte vollständig geladen sind.
Für beliebte Websites (Amazon, LinkedIn, Google) verwende unsere vorgefertigten Parser, um automatisch strukturierte Daten zu erhalten.
Beim Verwenden von extract_urls oder crawl_website verwende Glob-Muster, um sich auf relevante Seiten zu konzentrieren und unnötige Verarbeitung zu vermeiden.
Implementiere exponentielles Backoff für Rate-Limit-Fehler. Die API behandelt die meisten Rate-Limits intern automatisch.

Support

Verwandte Ressourcen

Scrapes API

Erfahre mehr über den Scrapes-Endpunkt

Batches API

Erfahre mehr über den Batches-Endpunkt

Answers API

Erfahre mehr über den Answers-Endpunkt

Maps API

Erfahre mehr über den Maps-Endpunkt

Crawls API

Erfahre mehr über den Crawls-Endpunkt

Python SDK

Erkunde das Python SDK

LangChain Website

LangChain-Plattform