curl --request GET \
--url https://api.olostep.com/v1/retrieve \
--header 'Authorization: Bearer <token>'import requests
url = "https://api.olostep.com/v1/retrieve"
headers = {"Authorization": "Bearer <token>"}
response = requests.get(url, headers=headers)
print(response.text)const options = {method: 'GET', headers: {Authorization: 'Bearer <token>'}};
fetch('https://api.olostep.com/v1/retrieve', options)
.then(res => res.json())
.then(res => console.log(res))
.catch(err => console.error(err));<?php
$curl = curl_init();
curl_setopt_array($curl, [
CURLOPT_URL => "https://api.olostep.com/v1/retrieve",
CURLOPT_RETURNTRANSFER => true,
CURLOPT_ENCODING => "",
CURLOPT_MAXREDIRS => 10,
CURLOPT_TIMEOUT => 30,
CURLOPT_HTTP_VERSION => CURL_HTTP_VERSION_1_1,
CURLOPT_CUSTOMREQUEST => "GET",
CURLOPT_HTTPHEADER => [
"Authorization: Bearer <token>"
],
]);
$response = curl_exec($curl);
$err = curl_error($curl);
curl_close($curl);
if ($err) {
echo "cURL Error #:" . $err;
} else {
echo $response;
}package main
import (
"fmt"
"net/http"
"io"
)
func main() {
url := "https://api.olostep.com/v1/retrieve"
req, _ := http.NewRequest("GET", url, nil)
req.Header.Add("Authorization", "Bearer <token>")
res, _ := http.DefaultClient.Do(req)
defer res.Body.Close()
body, _ := io.ReadAll(res.Body)
fmt.Println(string(body))
}HttpResponse<String> response = Unirest.get("https://api.olostep.com/v1/retrieve")
.header("Authorization", "Bearer <token>")
.asString();require 'uri'
require 'net/http'
url = URI("https://api.olostep.com/v1/retrieve")
http = Net::HTTP.new(url.host, url.port)
http.use_ssl = true
request = Net::HTTP::Get.new(url)
request["Authorization"] = 'Bearer <token>'
response = http.request(request)
puts response.read_body{
"html_content": "<string>",
"markdown_content": "<string>",
"json_content": "<string>",
"html_hosted_url": "<string>",
"markdown_hosted_url": "<string>",
"json_hosted_url": "<string>",
"size_exceeded": true
}Inhalte abrufen
Inhalte von verarbeiteten Batches und Crawls-URLs abrufen.
curl --request GET \
--url https://api.olostep.com/v1/retrieve \
--header 'Authorization: Bearer <token>'import requests
url = "https://api.olostep.com/v1/retrieve"
headers = {"Authorization": "Bearer <token>"}
response = requests.get(url, headers=headers)
print(response.text)const options = {method: 'GET', headers: {Authorization: 'Bearer <token>'}};
fetch('https://api.olostep.com/v1/retrieve', options)
.then(res => res.json())
.then(res => console.log(res))
.catch(err => console.error(err));<?php
$curl = curl_init();
curl_setopt_array($curl, [
CURLOPT_URL => "https://api.olostep.com/v1/retrieve",
CURLOPT_RETURNTRANSFER => true,
CURLOPT_ENCODING => "",
CURLOPT_MAXREDIRS => 10,
CURLOPT_TIMEOUT => 30,
CURLOPT_HTTP_VERSION => CURL_HTTP_VERSION_1_1,
CURLOPT_CUSTOMREQUEST => "GET",
CURLOPT_HTTPHEADER => [
"Authorization: Bearer <token>"
],
]);
$response = curl_exec($curl);
$err = curl_error($curl);
curl_close($curl);
if ($err) {
echo "cURL Error #:" . $err;
} else {
echo $response;
}package main
import (
"fmt"
"net/http"
"io"
)
func main() {
url := "https://api.olostep.com/v1/retrieve"
req, _ := http.NewRequest("GET", url, nil)
req.Header.Add("Authorization", "Bearer <token>")
res, _ := http.DefaultClient.Do(req)
defer res.Body.Close()
body, _ := io.ReadAll(res.Body)
fmt.Println(string(body))
}HttpResponse<String> response = Unirest.get("https://api.olostep.com/v1/retrieve")
.header("Authorization", "Bearer <token>")
.asString();require 'uri'
require 'net/http'
url = URI("https://api.olostep.com/v1/retrieve")
http = Net::HTTP.new(url.host, url.port)
http.use_ssl = true
request = Net::HTTP::Get.new(url)
request["Authorization"] = 'Bearer <token>'
response = http.request(request)
puts response.read_body{
"html_content": "<string>",
"markdown_content": "<string>",
"json_content": "<string>",
"html_hosted_url": "<string>",
"markdown_hosted_url": "<string>",
"json_hosted_url": "<string>",
"size_exceeded": true
}Einführung
Mit dem Endpunkt/v1/retrieve kannst du die Inhalte von zuvor verarbeiteten Batches und Crawls abrufen. Dies ist nützlich, um auf die gesammelten Daten zuzugreifen und sie in deinen Anwendungen zu verwenden.
Anfrage
Um Inhalte abzurufen, sende eineGET-Anfrage an den Endpunkt /v1/retrieve mit den erforderlichen Parametern.
Anfrageparameter
- batchId: Die eindeutige Kennung des Batches, dessen Inhalte du abrufen möchtest.
- crawlId: Die eindeutige Kennung des Crawls, dessen Inhalte du abrufen möchtest.
Beispielanfrage
GET /v1/retrieve?batchId=12345&crawlId=67890 HTTP/1.1
Host: api.olostep.com
Authorization: Bearer your-access-token
Antwort
Bei einer erfolgreichen Anfrage erhältst du eine Antwort mit dem Inhalt der angegebenen Batches und Crawls.Antwortstruktur
- status: Der Status der Anfrage (z.B.
success). - data: Ein Array mit den abgerufenen Inhalten.
- message: Eine optionale Nachricht mit zusätzlichen Informationen.
Beispielantwort
{
"status": "success",
"data": [
{
"url": "http://example.com",
"content": "Beispielinhalt"
}
],
"message": "Inhalte erfolgreich abgerufen."
}
Fehlerbehandlung
Sollte ein Fehler auftreten, enthält die Antwort Informationen über die Art des Fehlers.Beispiel für eine Fehlermeldung
{
"status": "error",
"message": "Ungültige Batch- oder Crawl-ID."
}
batchId und crawlId übermittelst, um solche Fehler zu vermeiden.Autorisierungen
Bearer-Authentifizierungsheader in der Form Bearer , wobei dein Authentifizierungstoken ist.
Abfrageparameter
Die ID des Seiteninhalts, der abgerufen werden soll. Verfügbar in der Antwort der Endpunkte /v1/crawls/{crawl_id}/pages, /v1/scrapes/{scrape_id} oder /v1/batches/{batch_id}/items
Optionale Liste, um nur spezifische Formate in der Produktion abzurufen. Wenn nicht angegeben, werden alle Formate zurückgegeben.
html, markdown, json Antwort
Erfolgreiche Antwort mit Seiteninhalt.
HTML-Inhalt der Seite, falls angefordert und verfügbar.
Markdown-Inhalt der Seite, falls angefordert und verfügbar.
JSON-Inhalt der Seite, der von Parsern zurückgegeben wird, falls angefordert und verfügbar.
S3-Bucket-URL von html. Läuft in 7 Tagen ab.
S3-Bucket-URL von markdown. Läuft in 7 Tagen ab.
S3-Bucket-URL von json. Läuft in 7 Tagen ab.
Wenn die Größe der Inhaltsobjekte das 6MB-Limit überschreitet. Wenn wahr, verwende gehostete S3-URLs, um den Inhalt zu erhalten.
War diese Seite hilfreich?