Skip to main content
Grâce au point de terminaison Olostep /v1/batches, tu peux traiter jusqu’à 10 000 URL en un seul lot. Un lot prend environ 5 à 8 minutes. Utilise-le pour extraire du contenu ou des données structurées à grande échelle de manière asynchrone.
  • Soumets jusqu’à 10 000 URL par lot
  • Un seul lot prend environ 5 à 8 minutes, quelle que soit la taille du lot. Le lot est un point de terminaison asynchrone
  • Exécute de nombreux lots en parallèle pour évoluer vers des millions de requêtes simultanées.
  • Utilise des analyseurs pour retourner du JSON structuré, ou récupère du markdown/html via /v1/retrieve
  • Si tu souhaites obtenir des résultats avec une faible latence ou de manière synchrone, utilise le point de terminaison de scraping et envoie de nombreuses requêtes simultanées à la place.
Pour les détails de l’API, consulte la Référence de l’API du point de terminaison Batch.
Note : Pour les nouveaux comptes, les lots sont limités à 100 éléments par lot. Pour lever cette limitation, contacte-nous à info@olostep.com ou rejoins-nous sur Slack.

Installation

Démarrer un lot

Fournis un tableau d’items avec un custom_id et une url. Ce sont les URL qui seront traitées dans le lot, le custom_id est un identifiant unique interne pour l’URL. Optionnellement, passe parser ou country. Grâce au paramètre parser, tu peux spécifier l’analyseur à utiliser pour le lot, cela retournera du JSON structuré à partir des pages.
Comme Olostep suit une approche orientée objet, tu recevras un objet batch en réponse. L’objet batch possède quelques propriétés comme id et status.

Vérifier le statut du lot

Interroge jusqu’à ce que le status soit completed. Tu peux également vérifier la propriété completed_urls pour voir combien d’URL ont été traitées.

Récupérer le contenu

Utilise le retrieve_id de chaque élément avec /v1/retrieve pour récupérer html_content, markdown_content, ou json_content.

Lister les éléments (pagination avec curseur)

Récupère les éléments en utilisant cursor et limit. Préfère utiliser /v1/retrieve avec retrieve_id pour le contenu.

Format de réponse

Lorsque tu exécutes le code d’exemple fourni, tu recevras une réponse comme la suivante
Comme nous avons passé l’analyseur pour récupérer le JSON structuré et que nous imprimons uniquement cela, la réponse contient :
  • json_content avec des résultats de recherche structurés incluant :
  • searchParameters : Informations sur la requête de recherche
  • knowledgeGraph : Informations détaillées sur le sujet de recherche (lorsque disponible)
  • organic : Liste des résultats de recherche avec titre, lien, position et extrait
  • peopleAlsoAsk : Questions connexes que les utilisateurs recherchent couramment
  • relatedSearches : Requêtes de recherche suggérées
Si tu ne veux pas le JSON structuré mais simplement le markdown ou html, tu peux les récupérer à partir du point de terminaison de récupération.

Webhooks

Au lieu de sonder le statut du lot, tu peux passer une URL de webhook lorsque tu crées le lot. Olostep envoie un HTTP POST à cette URL lorsque le lot se termine (tous les éléments sont complétés ou échoués). Ton point de terminaison de webhook doit être publiquement accessible via http:// ou https://. Il ne peut pas pointer vers localhost ou des adresses IP privées. Pour la forme complète de la charge utile, le comportement de reprise et les meilleures pratiques (répondre rapidement avec 2xx, dédupliquer en utilisant l’événement id), consulte Webhooks.
Nom du paramètre : Le champ canonique est webhook. Pour la compatibilité ascendante, webhook_url est également accepté comme alias.
Pour les lots, l’événement batch.completed inclut l’id du lot, le statut et le nombre d’éléments. Les livraisons échouées sont automatiquement réessayées (jusqu’à 5 tentatives sur environ 30 minutes avec un backoff exponentiel). Ton gestionnaire doit retourner un statut 2xx dans un délai de 30 secondes par tentative.

Métadonnées

Attache des métadonnées personnalisées clé-valeur de chaîne aux lots pour suivre, filtrer et corréler les travaux avec tes propres systèmes (ID de commande, noms de projet, étape du pipeline, etc.). Les métadonnées suivent les mêmes règles que dans notre référence Métadonnées. Tu peux définir des métadonnées à deux niveaux lors de la création d’un lot :
  • Niveau du lotmetadata sur le corps de la requête (s’applique à l’ensemble du lot)
  • Niveau de l’élémentmetadata sur chaque objet dans le tableau items (par URL)
Les métadonnées sont retournées lors des réponses GET suivantes pour ce lot. Tu peux mettre à jour par fusion les métadonnées du lot plus tard avec Mise à jour du lot (PATCH); vois le guide des métadonnées pour le comportement d’ajout, de remplacement et de suppression.
Coercition de type : Les nombres et les booléens sont convertis en chaînes (par exemple 42"42", true"true"). Les objets et tableaux imbriqués sont rejetés.
Pour des exemples complets et les sémantiques PATCH, consulte Métadonnées.

Notes Importantes

Si tu veux du JSON structuré, tu dois passer l’analyseur spécifique à l’API avant de faire les requêtes. Par exemple, si tu veux obtenir le JSON de Google Search, tu passeras cet analyseur "parser": {"id": "@olostep/google-search"} Tu peux créer tes propres analyseurs pour récupérer les données que tu veux de n’importe quelle page. Contacte info@olostep.com pour en savoir plus.

Conclusion

Le point de terminaison batch est utile si tu as besoin d’obtenir des données de nombreuses URL en peu de temps. Tu dois déjà avoir la liste des URL dont tu veux obtenir les données. Les applications courantes peuvent être :
  • Services de suivi des prix qui surveillent plusieurs sites de commerce électronique pour les changements de prix sur les produits
  • Outils de surveillance de sites web qui vérifient les mises à jour de contenu sur de nombreuses pages
  • Agrégation de données pour les organisateurs de concerts suivant la disponibilité des billets sur plusieurs lieux
  • Moteurs de recherche collectant et indexant du contenu de nombreux sites web simultanément
  • Agrégateurs de nouvelles collectant des articles de diverses publications
  • Plateformes immobilières surveillant les annonces de propriétés sur plusieurs sites
  • Sites d’emploi agrégeant les offres d’emploi des pages de carrière des entreprises
  • Services de données financières suivant les prix des actions et les informations du marché
  • Outils de surveillance des médias sociaux analysant les mentions sur différentes plateformes
  • Recherche académique collectant des données de multiples sources pour analyse
Il est préférable d’utiliser le point de terminaison batch si tu veux le contenu de 100 à 10 000 URL à la fois. Si tu as besoin de scraper moins de 50 URL à la fois, nous recommandons d’utiliser le point de terminaison de scraping et de soumettre les URL en parallèle car c’est plus rapide que le point de terminaison batch.

Tarification

Le batch coûte 1 crédit par URL.