Skip to main content
GET
Starte das Scraping von Webseiten mit verschiedenen Konfigurationen

Authorizations

Authorization
string
header
required

Bearer-Authentifizierungsheader in der Form Bearer , wobei dein Authentifizierungstoken ist.

Query Parameters

url
string<uri>
required

Die URL, von der aus das Scraping gestartet werden soll.

timeout
integer
default:40

Timeout in Sekunden für den Scraping-Prozess, mit einem Maximum von 620 Sekunden.

waitBeforeScraping
integer
default:3

Zeit in Sekunden, die gewartet werden soll, bevor das Scraping beginnt, bis zu 500 Sekunden.

saveHtml
boolean
default:true

Option, den gescrapten Inhalt als HTML zu speichern.

saveMarkdown
boolean
default:true

Option, den gescrapten Inhalt als Markdown zu speichern.

removeCSSselectors
enum<string>
default:default

Option, bestimmte CSS-Selektoren aus dem Inhalt zu entfernen. Optional kannst du auch ein JSON-stringifiziertes Array von spezifischen Selektoren übergeben, die du entfernen möchtest. Die CSS-Selektoren, die entfernt werden, wenn diese Option auf default gesetzt ist, sind ['nav','footer','script','style','noscript','svg',[role=alert],[role=banner],[role=dialog],[role=alertdialog],[role=region][aria-label*=skip i],[aria-modal=true]]

Available options:
default,
none,
JSON stringified array of CSS selectors
htmlTransformer
enum<string>
default:none

Gib den HTML-Transformer an, der verwendet werden soll, falls vorhanden. Die Mercury Parser-Bibliothek von Postlight wird verwendet, um Werbung und andere unerwünschte Inhalte aus dem gescrapten Inhalt zu entfernen.

Available options:
none,
postlightParser
removeImages
boolean
default:true

Option, Bilder aus dem gescrapten Inhalt zu entfernen.

expandMarkdown
boolean
default:false

Wenn true, wird der Markdown-Inhalt im markdown_content-Feld zurückgegeben.

expandHtml
boolean
default:false

Wenn true, wird der HTML-Inhalt im html_content-Feld zurückgegeben.

actions
(Warten · object | Klicken · object | Eingabe ausfüllen · object | Scrollen · object)[]

Aktionen, die auf der Seite ausgeführt werden sollen, bevor der Inhalt abgerufen wird

Response

Erfolgreiche Antwort mit den angeforderten Daten.