Alles is een Object
Elke resource in Olostep is een object met een unieke identificatie. Of je het nu creëert via de API, SDK of dashboard — je krijgt een object terug dat je kunt refereren, bijwerken en opvragen.Objecten Kunnen Levenscycli Hebben
Sommige Olostep-objecten volgen de status via eenstatus veld. Dit toestandsmachinepatroon laat je precies weten waar elke resource zich in zijn levenscyclus bevindt.
Batches
Batches hebben twee niveaus van status: de batch zelf en individuele items. Batch Status:Batch-niveau fouten zijn uiterst zeldzaam. Batches worden bijna altijd voltooid — zelfs als sommige URL’s falen, bereikt de batch zelf de
completed status. In het zeldzame geval van een catastrofale infrastructuurfout (bijv. LLM-service uitval tijdens verrijking), kan de batch falen. Dit treft minder dan 0,01% van de batches.
Items kunnen falen door:
- URL is geblokkeerd of retourneert een fout
- Parser output ontbreekt
- Netwerk/fetch fouten
error object met code en message die de fout uitleggen. De batch wordt nog steeds voltooid — controleer de status van elk item bij het verwerken van resultaten.
Crawls
Crawls worden altijd voltooid. Zelfs als een crawl 0 URL’s vindt (door robots.txt blokkering of ongeldige start-URL), zal de crawl status
completed zijn. Controleer het pages_count veld om resultaten te verifiëren.Monitors
Monitors zijn langlevende objecten met een rijkere levenscyclus dan eenmalige resources:
Het creëren van een monitor retourneert HTTP
202 met status: provisioning. De monitor wordt active zodra de planning zijn getraceerde doelen oplost — poll GET /v1/monitors/:monitor_id of stream provisioning events met ?stream=1. Alleen active monitors kunnen gepauzeerd worden, en alleen paused monitors kunnen hervat worden. Updates retourneren 409 terwijl de monitor nog provisioning is.
Retrieve Patroon
Veel objecten produceren inhoud die later kan worden opgehaald. Hetretrieve_id patroon laat je inhoud ophalen zonder opnieuw te verwerken.
- Batch items — Elke verwerkte URL krijgt een
retrieve_id - Crawl pagina’s — Elke gecrawlde pagina krijgt een
retrieve_id
/v1/retrieve endpoint accepteert de formats parameter om te specificeren welke inhoudstypen moeten worden geretourneerd (html, markdown, json, text).