Skip to main content
La integración de Olostep Mastra aporta potentes capacidades de extracción de datos web a los agentes de Mastra.ai. Olostep es una API de búsqueda web, scraping y crawling — una API para buscar, extraer y estructurar datos web. Construye agentes de IA inteligentes que puedan buscar, extraer, analizar y estructurar datos de cualquier sitio web de manera autónoma. Instalar desde npm →

Características

La integración proporciona 4 potentes APIs para la extracción automatizada de datos web:

Extraer Sitio Web

Extrae contenido de cualquier URL en múltiples formatos (Markdown, HTML, JSON, texto)

Extraer URLs en Lote

Procesa hasta 100,000 URLs en paralelo. Perfecto para extracción de datos a gran escala

Crear Rastreo

Descubre y extrae sitios web enteros de manera autónoma siguiendo enlaces

Crear Mapa

Extrae todas las URLs de un sitio web para análisis de estructura del sitio y descubrimiento de contenido

Instalación

Configuración

1. Instalar el Paquete

2. Importar y Registrar Integración

En tu archivo de configuración de Mastra:

3. Configurar la Clave de API

Establece tu clave de API de Olostep como una variable de entorno:
O en tu archivo .env:
Obtén tu clave de API desde el Panel de Olostep.

APIs Disponibles

La integración expone 4 APIs que tus agentes de Mastra pueden usar:

scrapeWebsite

Extrae contenido de una sola URL. Soporta múltiples formatos y renderizado de JavaScript. Casos de Uso:
  • Monitorear cambios en páginas específicas
  • Extraer información de productos de sitios de comercio electrónico
  • Recopilar datos de artículos de noticias o publicaciones de blogs
  • Obtener contenido para agregación de contenido
Parámetros del Esquema:
string
requerido
Tu clave de API de Olostep
string
requerido
URL del sitio web a extraer (debe incluir http:// o https://)
array
predeterminado:"['markdown']"
Formatos de salida: [‘html’, ‘markdown’, ‘json’, ‘text’]
string
Código de país para contenido específico de ubicación (por ejemplo, “US”, “GB”, “CA”)
number
Tiempo de espera en milisegundos para renderizado de JavaScript (0-10000)
string
ID de parser opcional para extracción especializada (por ejemplo, “@olostep/amazon-product”)
Respuesta:
  • id - ID de extracción
  • url_to_scrape - URL extraída
  • result.markdown_content - Contenido en Markdown
  • result.html_content - Contenido en HTML
  • result.json_content - Contenido en JSON
  • result.text_content - Contenido en texto
  • result.screenshot_hosted_url - URL de captura de pantalla (si está disponible)
  • result.markdown_hosted_url - URL de Markdown alojado
  • object - Tipo de objeto (“scrape”)
  • created - Marca de tiempo Unix
Ejemplo de Uso:

batchScrape

Procesa múltiples URLs en paralelo (hasta 100,000 a la vez). Perfecto para extracción de datos a gran escala. Casos de Uso:
  • Extraer catálogos de productos completos
  • Extraer datos de múltiples resultados de búsqueda
  • Procesar listas de URLs de hojas de cálculo
  • Extracción de contenido a granel
Parámetros del Esquema:
string
requerido
Tu clave de API de Olostep
array
requerido
Array de objetos con campos url y custom_id opcionalEjemplo: [{"url":"https://example.com","custom_id":"site1"}]
array
predeterminado:"['markdown']"
Formatos de salida para todas las URLs
string
Código de país para extracción específica de ubicación
number
Tiempo de espera en milisegundos para renderizado de JavaScript
string
ID de parser opcional para extracción especializada
Respuesta:
  • batch_id - ID de lote (usa esto para recuperar resultados más tarde)
  • status - Estado del procesamiento
  • object - Tipo de objeto (“batch”)
Ejemplo de Uso:

createCrawl

Descubre y extrae sitios web enteros de manera autónoma siguiendo enlaces. Perfecto para sitios de documentación, blogs y repositorios de contenido. Casos de Uso:
  • Rastrear y archivar sitios de documentación completos
  • Extraer todas las publicaciones de blog de un sitio web
  • Construir bases de conocimiento a partir de contenido web
  • Monitorear cambios en la estructura del sitio web
Parámetros del Esquema:
string
requerido
Tu clave de API de Olostep
string
requerido
URL de inicio para el rastreo (debe incluir http:// o https://)
number
predeterminado:"10"
Número máximo de páginas a rastrear. Establecer en 1 para extraer solo la URL de inicio.
array
predeterminado:"['markdown']"
Formato para el contenido extraído
string
Código de país opcional para rastreo específico de ubicación
string
ID de parser opcional para extracción de contenido especializada
Respuesta:
  • id - ID de rastreo (usa esto para recuperar resultados más tarde)
  • object - Tipo de objeto (“crawl”)
  • status - Estado del rastreo
  • created - Marca de tiempo Unix
Ejemplo de Uso:

createMap

Extrae todas las URLs de un sitio web para descubrimiento de contenido y análisis de estructura del sitio. Casos de Uso:
  • Construir sitemaps y diagramas de estructura del sitio
  • Descubrir todas las páginas antes de extraer en lote
  • Encontrar páginas rotas o faltantes
  • Auditorías y análisis de SEO
Parámetros del Esquema:
string
requerido
Tu clave de API de Olostep
string
requerido
URL del sitio web para extraer enlaces (debe incluir http:// o https://)
string
Consulta de búsqueda opcional para filtrar URLs (por ejemplo, “blog”)
number
Limitar el número de URLs devueltas
array
Patrones glob para incluir rutas específicas (por ejemplo, [“/blog/**”])
array
Patrones glob para excluir rutas específicas (por ejemplo, [“/admin/**”])
Respuesta:
  • id - ID de mapa
  • object - Tipo de objeto (“map”)
  • url - URL del sitio web
  • total_urls - Total de URLs encontradas
  • urls - Array de URLs descubiertas
Ejemplo de Uso:

Uso con Agentes

Ejemplo Básico de Agente

Crea un agente que pueda extraer sitios web:

Ejemplo de Flujo de Trabajo de Agente

Construye un flujo de trabajo de investigación que descubra y extraiga contenido:

Casos de Uso Populares

Agente de Investigación

Construye un agente que investigue temas de manera autónoma:
Flujo de Trabajo:
  1. El usuario pregunta: “Investiga tendencias de IA”
  2. El agente usa createMap para descubrir páginas relevantes
  3. El agente usa batchScrape para extraer contenido
  4. El agente analiza y resume los hallazgos
  5. Devuelve un informe de investigación estructurado
Flujo de Trabajo:
  1. Programa monitoreo diario
  2. Usa scrapeWebsite para revisar páginas de competidores
  3. Compara con datos anteriores
  4. Alerta sobre cambios significativos
  5. Genera informes semanales
Flujo de Trabajo:
  1. Usa createCrawl para descubrir todas las publicaciones de blog
  2. Usa batchScrape para extraer contenido
  3. Procesa con IA para extraer temas clave
  4. Almacena en base de conocimiento
  5. Genera calendario de contenido

Inteligencia de Comercio Electrónico

Monitorea productos y precios:

Análisis SEO

Analiza la estructura y contenido del sitio web:

Parsers Especializados

Olostep proporciona parsers preconstruidos para sitios web populares. Úsalos con el parámetro parser:

Búsqueda de Google

@olostep/google-searchExtraer: resultados de búsqueda, títulos, fragmentos, URLs

Google Maps

@olostep/google-mapsExtraer: información de negocios, reseñas, calificaciones, ubicación

Uso de Parsers

Añade el ID del parser al parámetro parser:
El parser extrae automáticamente datos estructurados específicos para ese tipo de sitio web.

Mejores Prácticas

Cuando extraigas más de 3-5 URLs, usa batchScrape en lugar de múltiples llamadas a scrapeWebsite. El procesamiento en lote es:
  • Mucho más rápido (procesamiento paralelo)
  • Más rentable
  • Más fácil de gestionar
  • Mejor para límites de tasa
Para sitios pesados en JavaScript, usa el parámetro wait_before_scraping:
  • Sitios simples: 0-1000ms
  • Sitios dinámicos: 2000-3000ms
  • JavaScript pesado: 5000-8000ms
Prueba con diferentes valores para encontrar el tiempo de espera óptimo.
Para sitios web populares (Amazon, LinkedIn, Google), usa parsers preconstruidos:
  • Obtén datos estructurados automáticamente
  • Extracción más confiable
  • No necesitas parsing personalizado
  • Mantenidos por Olostep
Las operaciones de Lote, Rastreo y Mapa son asíncronas:
  • Almacena el ID devuelto (batch_id, crawl_id, map_id)
  • Haz polling para completar o usa webhooks
  • Configura flujos de trabajo separados para la recuperación
Siempre envuelve las llamadas a la API en bloques try-catch:
Ten en cuenta los límites de tasa:
  • Espacia las solicitudes con retrasos
  • Usa procesamiento en lote cuando sea posible
  • Monitorea el uso en el panel de Olostep
  • Mejora el plan si es necesario

Ejemplo Completo

Aquí tienes un ejemplo completo de cómo construir un agente de investigación:

Solución de Problemas

Error: “Clave de API inválida”Soluciones:
  • Verifica la clave de API desde el panel
  • Asegúrate de que la clave de API esté establecida en la variable de entorno
  • Verifica que la clave de API esté activa
  • Revisa si hay espacios extra en la clave de API
Error: “API no encontrada” o “Integración no registrada”Soluciones:
  • Asegúrate de que registerApis() se llame después de crear la integración
  • Verifica que la integración esté añadida a la configuración de Mastra
  • Revisa que el nombre de la integración sea ‘olostep’
  • Reinicia el servidor de Mastra después de los cambios
Error: Los campos de contenido están vacíosSoluciones:
  • Aumenta el tiempo de wait_before_scraping
  • Verifica si el sitio web requiere inicio de sesión
  • Prueba con un formato diferente (HTML vs Markdown)
  • Verifica que la URL sea accesible
  • Revisa si el sitio bloquea el acceso automatizado
Error: “Límite de tasa excedido”Soluciones:
  • Espacia las solicitudes con retrasos
  • Usa procesamiento en lote en lugar de extracciones individuales
  • Mejora tu plan de Olostep
  • Verifica el límite de tasa en el panel
Error: Módulo no encontrado o errores de tipoSoluciones:
  • Asegúrate de que @mastra/core esté instalado
  • Verifica la compatibilidad de la versión de TypeScript
  • Verifica que todas las dependencias estén instaladas
  • Reconstruye: npm run build

Precios

Olostep cobra basado en el uso de la API, independientemente de Mastra:
  • Extracciones: Pago por extracción
  • Lotes: Pago por URL en lote
  • Rastreos: Pago por página rastreada
  • Mapas: Pago por operación de mapa
Consulta los precios actuales en olostep.com/pricing.

Soporte

¿Necesitas ayuda con la integración de Mastra?

Documentación

Navega por la documentación completa de la API

Correo de Soporte

Documentos de Mastra

Aprende sobre el marco de Mastra

Recursos Relacionados

API de Extracciones

Aprende sobre el endpoint de Extracciones

API de Lotes

Aprende sobre el endpoint de Lotes

API de Rastreos

Aprende sobre el endpoint de Rastreos

API de Mapas

Aprende sobre el endpoint de Mapas

Integración con Zapier

Automatiza con flujos de trabajo de Zapier

Integración con LangChain

Construye agentes de IA con LangChain

Sitio Web de Mastra

Plataforma Mastra

Comienza Ahora

¿Listo para construir agentes de IA con capacidades de scraping web?

Instalar Paquete

Instala @olostep/mastra-tools desde npm
¡Construye agentes de IA inteligentes que puedan buscar, extraer y estructurar datos web con Olostep y Mastra!