Maak Scrape
Scrape een url met de opgegeven configuratie en verkrijg inhoud.
Autorisaties
Bearer authenticatie header in de vorm Bearer , waar jouw auth token is.
Body
De URL om te beginnen met scrapen.
Tijd om te wachten in milliseconden voordat de scraping begint.
Formaten waarin je de inhoud wilt.
html, markdown, text, json, raw_pdf, screenshot Optie om bepaalde CSS-selectors uit de inhoud te verwijderen. Optioneel kun je ook een JSON-geformatteerde array van specifieke selectors doorgeven die je wilt verwijderen. De CSS-selectors die worden verwijderd wanneer deze optie is ingesteld op standaard zijn ['nav','footer','script','style','noscript','svg',[role=alert],[role=banner],[role=dialog],[role=alertdialog],[role=region][aria-label*=skip i],[aria-modal=true]]
default, none, array Acties om uit te voeren op de pagina voordat je de inhoud krijgt.
- Wachten
- Klik
- Vul Invoer In
- Scrollen
Woonland van waaruit het verzoek wordt geladen. Ondersteunde waarden zijn: - US (Verenigde Staten) - CA (Canada) - IT (Italië) - IN (India) - GB (Engeland) - JP (Japan) - MX (Mexico) - AU (Australië) - ID (Indonesië) - UA (VAE) - RU (Rusland) - RANDOM Sommige operaties, zoals het scrapen van Google Search en Google News, ondersteunen alle landen.
Specificeer de HTML-transformer die je wilt gebruiken, indien van toepassing. Postlight's Mercury Parser-bibliotheek wordt gebruikt om advertenties en andere ongewenste inhoud uit de gescrapete inhoud te verwijderen.
postlight, none Optie om afbeeldingen uit de gescrapete inhoud te verwijderen. Standaard is false.
Lijst van class-namen om uit de inhoud te verwijderen.
Wanneer je json als formaat definieert, kun je deze parameter gebruiken om de parser te specificeren die je wilt gebruiken. Parsers zijn nuttig om gestructureerde inhoud uit webpagina's te halen. Olostep heeft een paar ingebouwde parsers voor de meest voorkomende webpagina's, en je kunt ook je eigen parsers maken.
Met deze optie kun je alle links krijgen die aanwezig zijn op de pagina die je scrapt. Links worden altijd geretourneerd als absolute URLs.
Configuratie voor schermgrootte. Vooraf ingestelde afmetingen zijn beschikbaar via screen_type: desktop (1920x1080), mobile (414x896), of default (768x1024).
Door de gebruiker gedefinieerde metadata. Nog niet ondersteund.
Maximale acceptabele leeftijd van gecachte inhoud, in seconden. Wanneer een overeenkomende scrape al bestaat en nieuwer is dan max_age seconden, geeft Olostep het opgeslagen resultaat terug in plaats van een nieuwe browser scrape te starten. Standaard is 0 (altijd vers scrapen). In de dashboard playground is de standaard 86400 (24 uur). De maximaal toegestane waarde is 604800 (7 dagen). Zie de sectie Caching in de Scrapes feature docs voor details.
x >= 0Respons
Succesvolle reactie met de details van de scrape initiatie.
Scrape ID
Het soort object. "scrape" voor dit endpoint.
Aangemaakte epoch
Door de gebruiker gedefinieerde metadata.
De URL die gescraped werd.
Aantal credits verbruikt door dit verzoek. Wordt ingevuld nadat de uitvoering voltooid is. Credits zijn de bron van waarheid voor facturering.
Geschatte kosten in USD voor dit verzoek. Wordt ingevuld nadat de uitvoering voltooid is. Berekend op basis van verbruikte credits en je abonnementsprijs — 99% nauwkeurig, maar credits_consumed is de gezaghebbende waarde.