Start agent
This is the endpoint to start the scraping agent (and optionally retrieve the scraped content using the expand parameters)
Authorizations
Bearer-Authentifizierungsheader in der Form Bearer , wobei dein Authentifizierungstoken ist.
Query Parameters
Die URL, von der aus das Scraping gestartet werden soll.
Timeout in Sekunden für den Scraping-Prozess, mit einem Maximum von 620 Sekunden.
Zeit in Sekunden, die gewartet werden soll, bevor das Scraping beginnt, bis zu 500 Sekunden.
Option, den gescrapten Inhalt als HTML zu speichern.
Option, den gescrapten Inhalt als Markdown zu speichern.
Option, bestimmte CSS-Selektoren aus dem Inhalt zu entfernen. Optional kannst du auch ein JSON-stringifiziertes Array von spezifischen Selektoren übergeben, die du entfernen möchtest. Die CSS-Selektoren, die entfernt werden, wenn diese Option auf default gesetzt ist, sind ['nav','footer','script','style','noscript','svg',[role=alert],[role=banner],[role=dialog],[role=alertdialog],[role=region][aria-label*=skip i],[aria-modal=true]]
default, none, JSON stringified array of CSS selectors Gib den HTML-Transformer an, der verwendet werden soll, falls vorhanden. Die Mercury Parser-Bibliothek von Postlight wird verwendet, um Werbung und andere unerwünschte Inhalte aus dem gescrapten Inhalt zu entfernen.
none, postlightParser Option, Bilder aus dem gescrapten Inhalt zu entfernen.
Wenn true, wird der Markdown-Inhalt im markdown_content-Feld zurückgegeben.
Wenn true, wird der HTML-Inhalt im html_content-Feld zurückgegeben.
Aktionen, die auf der Seite ausgeführt werden sollen, bevor der Inhalt abgerufen wird
- Warten
- Klicken
- Eingabe ausfüllen
- Scrollen
Response
Erfolgreiche Antwort mit den angeforderten Daten.