Passer au contenu principal
POST
Initier un scraping de page web
Mise en cache optionnelle : Passez max_age (en secondes) pour réutiliser un scrape récent avec les mêmes paramètres au lieu de récupérer à nouveau la page. Par défaut, il est à 0 (toujours frais). Dans le bac à sable du tableau de bord, la valeur par défaut est de 24 heures. Voir Mise en cache pour plus de détails.

Autorisations

Authorization
string
header
requis

En-tête d'authentification Bearer sous la forme Bearer , où est ton jeton d'authentification.

Corps

application/json
url_to_scrape
string<uri>
requis

L'URL à partir de laquelle commencer le scraping.

wait_before_scraping
integer

Temps d'attente en millisecondes avant de commencer le scraping.

formats
enum<string>[]

Formats dans lesquels tu veux le contenu.

Options disponibles:
html,
markdown,
text,
json,
raw_pdf,
screenshot
remove_css_selectors
enum<string>

Option pour supprimer certains sélecteurs CSS du contenu. Tu peux également passer un tableau JSON sous forme de chaîne des sélecteurs spécifiques que tu veux supprimer. Les sélecteurs CSS supprimés lorsque cette option est définie par défaut sont ['nav','footer','script','style','noscript','svg',[role=alert],[role=banner],[role=dialog],[role=alertdialog],[role=region][aria-label*=skip i],[aria-modal=true]]

Options disponibles:
default,
none,
array
actions
(Attendre · object | Cliquer · object | Remplir l'entrée · object | Faire défiler · object)[]

Actions à effectuer sur la page avant d'obtenir le contenu.

country
string

Pays résidentiel à partir duquel charger la requête. Valeurs supportées : - US (États-Unis) - CA (Canada) - IT (Italie) - IN (Inde) - GB (Angleterre) - JP (Japon) - MX (Mexique) - AU (Australie) - ID (Indonésie) - UA (Émirats Arabes Unis) - RU (Russie) - RANDOM Certaines opérations, comme le scraping de Google Search et Google News, supportent tous les pays.

transformer
enum<string>

Spécifie le transformateur HTML à utiliser, si nécessaire. La bibliothèque Mercury Parser de Postlight est utilisée pour supprimer les publicités et autres contenus indésirables du contenu scrappé.

Options disponibles:
postlight,
none
remove_images
boolean
défaut:false

Option pour supprimer les images du contenu extrait. Par défaut, c'est false.

remove_class_names
string[]

Liste des noms de classes à supprimer du contenu.

parser
object

Lors de la définition de json comme format, tu peux utiliser ce paramètre pour spécifier le parseur à utiliser. Les parseurs sont utiles pour extraire du contenu structuré des pages web. Olostep a quelques parseurs intégrés pour les pages web les plus courantes, et tu peux aussi créer tes propres parseurs.

llm_extract
object

Avec cette option, tu peux obtenir tous les liens présents sur la page que tu scrapes. Les liens sont toujours retournés sous forme d'URLs absolues.

screen_size
object

Configuration pour la taille de l'écran. Des dimensions prédéfinies sont disponibles via screen_type : desktop (1920x1080), mobile (414x896), ou default (768x1024).

screenshot
object
metadata
object

Métadonnées définies par l'utilisateur. Pas encore supporté.

max_age
integer
défaut:0

Âge maximum acceptable du contenu mis en cache, en secondes. Lorsqu'une capture correspondante existe déjà et est plus récente que max_age secondes, Olostep renvoie le résultat stocké au lieu de lancer une nouvelle capture de navigateur. Par défaut, c'est 0 (toujours capturer à nouveau). Dans le tableau de bord, le défaut est 86400 (24 heures). La valeur maximale autorisée est 604800 (7 jours). Voir la section Caching dans la documentation des fonctionnalités Scrapes pour plus de détails.

Plage requise: x >= 0

Réponse

Réponse réussie avec les détails de l'initiation de la capture.

id
string

ID de la capture

object
string

Le type d'objet. "scrape" pour ce point de terminaison.

created
number

Époque créée

metadata
object

Métadonnées définies par l'utilisateur.

url_to_scrape
string

L'URL qui a été capturée.

result
object
credits_consumed
integer | null

Nombre de crédits consommés par cette requête. Rempli après l'exécution terminée. Les crédits sont la source de vérité pour la facturation.

cost_usd
number | null

Coût estimé en USD pour cette requête. Rempli après l'exécution terminée. Calculé à partir des crédits consommés et de ton tarif de plan — 99% précis, mais credits_consumed est la valeur faisant autorité.