Zum Hauptinhalt springen
Die Olostep Mastra-Integration bringt leistungsstarke Webdatenextraktionsfähigkeiten zu Mastra.ai-Agenten. Olostep ist eine Websuche, Scraping und Crawling API — eine API zum Suchen, Extrahieren und Strukturieren von Webdaten. Baue intelligente KI-Agenten, die autonom Daten von jeder Website suchen, scrapen, analysieren und strukturieren können. Von npm installieren →

Funktionen

Die Integration bietet 4 leistungsstarke APIs für die automatisierte Webdatenextraktion:

Website scrapen

Extrahiere Inhalte von jeder einzelnen URL in mehreren Formaten (Markdown, HTML, JSON, Text)

URLs im Batch scrapen

Verarbeite bis zu 100.000 URLs parallel. Perfekt für die Extraktion von großen Datenmengen

Crawl erstellen

Entdecke und scrape ganze Websites autonom, indem du Links folgst

Karte erstellen

Extrahiere alle URLs von einer Website für die Analyse der Seitenstruktur und Inhaltsentdeckung

Installation

Einrichtung

1. Paket installieren

2. Integration importieren und registrieren

In deiner Mastra-Konfigurationsdatei:

3. API-Schlüssel konfigurieren

Setze deinen Olostep-API-Schlüssel als Umgebungsvariable:
Oder in deiner .env Datei:
Hole deinen API-Schlüssel vom Olostep Dashboard.

Verfügbare APIs

Die Integration stellt 4 APIs zur Verfügung, die deine Mastra-Agenten nutzen können:

scrapeWebsite

Extrahiere Inhalte von einer einzelnen URL. Unterstützt mehrere Formate und JavaScript-Rendering. Anwendungsfälle:
  • Überwache spezifische Seiten auf Änderungen
  • Extrahiere Produktinformationen von E-Commerce-Seiten
  • Sammle Daten aus Nachrichtenartikeln oder Blogbeiträgen
  • Ziehe Inhalte für Content-Aggregation
Schema-Parameter:
apiKey
string
erforderlich
Dein Olostep-API-Schlüssel
url_to_scrape
string
erforderlich
Website-URL zum Scrapen (muss http:// oder https:// enthalten)
formats
array
Standard:"['markdown']"
Ausgabeformate: [‘html’, ‘markdown’, ‘json’, ‘text’]
country
string
Ländercode für ortsspezifische Inhalte (z.B. “US”, “GB”, “CA”)
wait_before_scraping
number
Wartezeit in Millisekunden für JavaScript-Rendering (0-10000)
parser
string
Optionaler Parser-ID für spezialisierte Extraktion (z.B. “@olostep/amazon-product”)
Antwort:
  • id - Scrape-ID
  • url_to_scrape - Gescrapte URL
  • result.markdown_content - Markdown-Inhalt
  • result.html_content - HTML-Inhalt
  • result.json_content - JSON-Inhalt
  • result.text_content - Textinhalt
  • result.screenshot_hosted_url - Screenshot-URL (falls verfügbar)
  • result.markdown_hosted_url - Gehostete Markdown-URL
  • object - Objekttyp (“scrape”)
  • created - Unix-Zeitstempel
Beispielverwendung:

batchScrape

Verarbeite mehrere URLs parallel (bis zu 100.000 auf einmal). Perfekt für die Extraktion von großen Datenmengen. Anwendungsfälle:
  • Scrape ganze Produktkataloge
  • Extrahiere Daten aus mehreren Suchergebnissen
  • Verarbeite Listen von URLs aus Tabellen
  • Masseninhalts-Extraktion
Schema-Parameter:
apiKey
string
erforderlich
Dein Olostep-API-Schlüssel
batch_array
array
erforderlich
Array von Objekten mit url und optionalen custom_id FeldernBeispiel: [{"url":"https://example.com","custom_id":"site1"}]
formats
array
Standard:"['markdown']"
Ausgabeformate für alle URLs
country
string
Ländercode für ortsspezifisches Scraping
wait_before_scraping
number
Wartezeit in Millisekunden für JavaScript-Rendering
parser
string
Optionaler Parser-ID für spezialisierte Extraktion
Antwort:
  • batch_id - Batch-ID (verwende dies, um Ergebnisse später abzurufen)
  • status - Verarbeitungsstatus
  • object - Objekttyp (“batch”)
Beispielverwendung:

createCrawl

Entdecke und scrape ganze Websites autonom, indem du Links folgst. Perfekt für Dokumentationsseiten, Blogs und Inhaltsrepositorien. Anwendungsfälle:
  • Crawle und archiviere ganze Dokumentationsseiten
  • Extrahiere alle Blogbeiträge von einer Website
  • Baue Wissensdatenbanken aus Webinhalten
  • Überwache Änderungen in der Website-Struktur
Schema-Parameter:
apiKey
string
erforderlich
Dein Olostep-API-Schlüssel
start_url
string
erforderlich
Start-URL für das Crawlen (muss http:// oder https:// enthalten)
max_pages
number
Standard:"10"
Maximale Anzahl von Seiten, die gecrawlt werden sollen. Setze auf 1, um nur die Start-URL zu scrapen.
formats
array
Standard:"['markdown']"
Format für gescrapte Inhalte
country
string
Optionaler Ländercode für ortsspezifisches Crawlen
parser
string
Optionaler Parser-ID für spezialisierte Inhaltsextraktion
Antwort:
  • id - Crawl-ID (verwende dies, um Ergebnisse später abzurufen)
  • object - Objekttyp (“crawl”)
  • status - Crawl-Status
  • created - Unix-Zeitstempel
Beispielverwendung:

createMap

Extrahiere alle URLs von einer Website für Inhaltsentdeckung und Seitenstrukturanalyse. Anwendungsfälle:
  • Baue Sitemaps und Diagramme der Seitenstruktur
  • Entdecke alle Seiten vor dem Batch-Scraping
  • Finde kaputte oder fehlende Seiten
  • SEO-Audits und Analysen
Schema-Parameter:
apiKey
string
erforderlich
Dein Olostep-API-Schlüssel
url
string
erforderlich
Website-URL, von der Links extrahiert werden sollen (muss http:// oder https:// enthalten)
search_query
string
Optionale Suchanfrage, um URLs zu filtern (z.B. “blog”)
top_n
number
Begrenze die Anzahl der zurückgegebenen URLs
include_urls
array
Glob-Muster, um spezifische Pfade einzuschließen (z.B. [“/blog/**”])
exclude_urls
array
Glob-Muster, um spezifische Pfade auszuschließen (z.B. [“/admin/**”])
Antwort:
  • id - Map-ID
  • object - Objekttyp (“map”)
  • url - Website-URL
  • total_urls - Gesamtzahl der gefundenen URLs
  • urls - Array der entdeckten URLs
Beispielverwendung:

Verwendung mit Agenten

Einfaches Agentenbeispiel

Erstelle einen Agenten, der Websites scrapen kann:

Agenten-Workflow-Beispiel

Erstelle einen Recherche-Workflow, der Inhalte entdeckt und scrapt:

Beliebte Anwendungsfälle

Recherche-Agent

Erstelle einen Agenten, der autonom Themen recherchiert:
Workflow:
  1. Benutzer fragt: “Recherchiere KI-Trends”
  2. Agent verwendet createMap, um relevante Seiten zu entdecken
  3. Agent verwendet batchScrape, um Inhalte zu extrahieren
  4. Agent analysiert und fasst die Ergebnisse zusammen
  5. Gibt strukturierten Forschungsbericht zurück
Workflow:
  1. Tägliche Überwachung planen
  2. Verwende scrapeWebsite, um Wettbewerberseiten zu überprüfen
  3. Vergleiche mit vorherigen Daten
  4. Benachrichtige bei signifikanten Änderungen
  5. Generiere wöchentliche Berichte
Workflow:
  1. Verwende createCrawl, um alle Blogbeiträge zu entdecken
  2. Verwende batchScrape, um Inhalte zu extrahieren
  3. Verarbeite mit KI, um wichtige Themen zu extrahieren
  4. Speichere in Wissensdatenbank
  5. Generiere Content-Kalender

E-Commerce-Intelligenz

Überwache Produkte und Preise:

SEO-Analyse

Analysiere Website-Struktur und Inhalte:

Spezialisierte Parser

Olostep bietet vorgefertigte Parser für beliebte Websites. Verwende sie mit dem parser Parameter:

Google Search

@olostep/google-searchExtrahiere: Suchergebnisse, Titel, Snippets, URLs

Google Maps

@olostep/google-mapsExtrahiere: Geschäftsinformationen, Bewertungen, Bewertungen, Standort

Verwendung von Parsern

Füge die Parser-ID zum parser Parameter hinzu:
Der Parser extrahiert automatisch strukturierte Daten, die spezifisch für diesen Website-Typ sind.

Best Practices

Wenn du mehr als 3-5 URLs scrapen möchtest, verwende batchScrape anstelle von mehreren scrapeWebsite-Aufrufen. Batch-Verarbeitung ist:
  • Viel schneller (parallele Verarbeitung)
  • Kostengünstiger
  • Einfacher zu verwalten
  • Besser für Ratenlimits
Für JavaScript-lastige Seiten verwende den wait_before_scraping Parameter:
  • Einfache Seiten: 0-1000ms
  • Dynamische Seiten: 2000-3000ms
  • Schweres JavaScript: 5000-8000ms
Teste mit verschiedenen Werten, um die optimale Wartezeit zu finden.
Für beliebte Websites (Amazon, LinkedIn, Google) verwende vorgefertigte Parser:
  • Erhalte automatisch strukturierte Daten
  • Zuverlässigere Extraktion
  • Keine Notwendigkeit für benutzerdefiniertes Parsing
  • Von Olostep gewartet
Batch-, Crawl- und Map-Operationen sind asynchron:
  • Speichere die zurückgegebene ID (batch_id, crawl_id, map_id)
  • Poll für Abschluss oder verwende Webhooks
  • Richte separate Workflows für den Abruf ein
Umfasse API-Aufrufe immer mit try-catch-Blöcken:
Achte auf Ratenlimits:
  • Verteile Anfragen mit Verzögerungen
  • Verwende Batch-Verarbeitung, wenn möglich
  • Überwache Nutzung im Olostep-Dashboard
  • Upgrade-Plan bei Bedarf

Komplettes Beispiel

Hier ist ein komplettes Beispiel für den Aufbau eines Recherche-Agenten:

Fehlerbehebung

Fehler: “Ungültiger API-Schlüssel”Lösungen:
  • Überprüfe den API-Schlüssel vom Dashboard
  • Stelle sicher, dass der API-Schlüssel als Umgebungsvariable gesetzt ist
  • Verifiziere, dass der API-Schlüssel aktiv ist
  • Überprüfe auf zusätzliche Leerzeichen im API-Schlüssel
Fehler: “API nicht gefunden” oder “Integration nicht registriert”Lösungen:
  • Stelle sicher, dass registerApis() nach der Erstellung der Integration aufgerufen wird
  • Verifiziere, dass die Integration zur Mastra-Konfiguration hinzugefügt wurde
  • Überprüfe, dass der Integrationsname ‘olostep’ ist
  • Starte den Mastra-Server nach Änderungen neu
Fehler: Inhaltsfelder sind leerLösungen:
  • Erhöhe die wait_before_scraping-Zeit
  • Überprüfe, ob die Website eine Anmeldung erfordert
  • Versuche ein anderes Format (HTML vs Markdown)
  • Verifiziere, dass die URL zugänglich ist
  • Überprüfe, ob die Seite automatisierten Zugriff blockiert
Fehler: “Ratenlimit überschritten”Lösungen:
  • Verteile Anfragen mit Verzögerungen
  • Verwende Batch-Verarbeitung anstelle von individuellen Scrapes
  • Upgrade deinen Olostep-Plan
  • Überprüfe das Ratenlimit im Dashboard
Fehler: Modul nicht gefunden oder TypfehlerLösungen:
  • Stelle sicher, dass @mastra/core installiert ist
  • Überprüfe die TypeScript-Version-Kompatibilität
  • Verifiziere, dass alle Abhängigkeiten installiert sind
  • Neu bauen: npm run build

Preisgestaltung

Olostep berechnet basierend auf der API-Nutzung, unabhängig von Mastra:
  • Scrapes: Bezahlung pro Scrape
  • Batches: Bezahlung pro URL im Batch
  • Crawls: Bezahlung pro gecrawlte Seite
  • Maps: Bezahlung pro Map-Operation
Überprüfe die aktuellen Preise auf olostep.com/pricing.

Support

Benötigst du Hilfe bei der Mastra-Integration?

Dokumentation

Durchsuche die vollständige API-Dokumentation

Support-E-Mail

Mastra-Dokumentation

Erfahre mehr über das Mastra-Framework

Verwandte Ressourcen

Scrapes API

Erfahre mehr über den Scrapes-Endpunkt

Batches API

Erfahre mehr über den Batches-Endpunkt

Crawls API

Erfahre mehr über den Crawls-Endpunkt

Maps API

Erfahre mehr über den Maps-Endpunkt

Zapier-Integration

Automatisiere mit Zapier-Workflows

LangChain-Integration

Baue KI-Agenten mit LangChain

Mastra-Website

Mastra-Plattform

Erste Schritte

Bereit, KI-Agenten mit Web-Scraping-Fähigkeiten zu erstellen?

Paket installieren

Installiere @olostep/mastra-tools von npm
Baue intelligente KI-Agenten, die mit Olostep und Mastra Webdaten suchen, extrahieren und strukturieren können!