Skip to main content
GET
Récupérer le contenu de la page

Autorisations

Authorization
string
header
requis

En-tête d'authentification Bearer sous la forme Bearer , où est ton jeton d'authentification.

Paramètres de requête

retrieve_id
string
requis

L'ID du contenu de la page à récupérer. Disponible dans la réponse des endpoints /v1/crawls/{crawl_id}/pages, /v1/scrapes/{scrape_id} ou /v1/batches/{batch_id}/items

formats
enum<string>[]

Tableau optionnel pour récupérer uniquement des formats spécifiques en production. Si non fourni, tous les formats seront retournés.

Options disponibles:
html,
markdown,
json

Réponse

Réponse réussie avec le contenu de la page.

html_content
string

Contenu HTML de la page, si demandé et disponible.

markdown_content
string

Contenu Markdown de la page, si demandé et disponible.

json_content
string

Contenu JSON de la page retourné par les parseurs, si demandé et disponible.

html_hosted_url
string

URL du bucket S3 de html. Expire dans 7 jours.

markdown_hosted_url
string

URL du bucket S3 de markdown. Expire dans 7 jours.

json_hosted_url
string

URL du bucket S3 de json. Expire dans 7 jours.

size_exceeded
boolean

Si la taille des objets de contenu dépasse la limite de 6MB. Si vrai, utilise les URLs S3 hébergées pour obtenir le contenu.