Skip to main content
La integración de Olostep LangChain proporciona herramientas completas para construir agentes de IA que pueden buscar, extraer, analizar y estructurar datos de cualquier sitio web. Perfecto para aplicaciones de LangChain y LangGraph.

Características

La integración proporciona acceso a las 5 capacidades de la API de Olostep:

Scrapes

Extrae contenido de cualquier URL única en múltiples formatos (Markdown, HTML, JSON, texto)

Batches

Procesa hasta 10,000 URLs en paralelo. Los trabajos por lotes se completan en 5-8 minutos

Answers

Búsqueda web impulsada por IA con consultas en lenguaje natural y salida estructurada

Maps

Extrae todas las URLs de un sitio web para análisis de estructura del sitio

Crawls

Descubre y extrae de forma autónoma sitios web completos siguiendo enlaces

Instalación

Configuración

Configura tu clave de API de Olostep como una variable de entorno:
Obtén tu clave de API desde el Panel de Olostep.

Herramientas Disponibles

scrape_website

Extrae contenido de una URL única. Soporta múltiples formatos y renderizado de JavaScript.
string
requerido
URL del sitio web para extraer (debe incluir http:// o https://)
string
predeterminado:"markdown"
Formato de salida: markdown, html, json, o text
string
Código de país para contenido específico de ubicación (e.g., “US”, “GB”, “CA”)
integer
Tiempo de espera en milisegundos para el renderizado de JavaScript (0-10000)
string
ID de parser opcional para extracción especializada (e.g., “@olostep/amazon-product”)

scrape_batch

Procesa múltiples URLs en paralelo (hasta 10,000 a la vez).
array
requerido
Lista de URLs para extraer
string
predeterminado:"markdown"
Formato de salida para todas las URLs: markdown, html, json, o text
string
Código de país para contenido específico de ubicación
integer
Tiempo de espera en milisegundos para el renderizado de JavaScript
string
ID de parser opcional para extracción especializada

answer_question

Busca en la web y obtén respuestas impulsadas por IA con fuentes. Perfecto para enriquecimiento de datos e investigación.
string
requerido
Pregunta o tarea para buscar
object
Diccionario/cadena de esquema JSON opcional que describe el formato de salida deseado

extract_urls

Extrae todas las URLs de un sitio web para análisis de estructura del sitio.
string
requerido
URL del sitio web para extraer URLs
string
Consulta de búsqueda opcional para filtrar URLs
integer
Limitar el número de URLs devueltas
array
Patrones glob para incluir (e.g., [“/blog/**”])
array
Patrones glob para excluir (e.g., [“/admin/**”])

crawl_website

Descubre y extrae de forma autónoma sitios web completos siguiendo enlaces.
string
requerido
URL de inicio para el rastreo
integer
predeterminado:"100"
Número máximo de páginas para rastrear
array
Patrones glob para incluir (e.g., [”/**”] para todos)
array
Patrones glob para excluir (e.g., [“/admin/**”])
integer
Profundidad máxima para rastrear desde start_url
boolean
predeterminado:"false"
Incluir URLs externas

Integración del Agente LangChain

Construye agentes inteligentes que pueden buscar y extraer de la web:

Integración de LangGraph

Construye flujos de trabajo complejos de múltiples pasos con LangGraph:

Casos de Uso Avanzados

Enriquecimiento de Datos

Enriquece datos de hojas de cálculo con información web:

Extracción de Productos de E-commerce

Extrae datos de productos con parsers especializados:

Auditoría SEO

Analiza sitios web completos para SEO:

Extracción de Documentación

Rastrea y extrae documentación:

Parsers Especializados

Olostep proporciona parsers preconstruidos para sitios web populares:
  • @olostep/google-search - Resultados de búsqueda de Google
Úsalos con el parámetro parser:

Manejo de Errores

Mejores Prácticas

Cuando extraigas más de 3-5 URLs, usa scrape_batch en lugar de múltiples llamadas a scrape_website. El procesamiento por lotes es mucho más rápido y rentable.
Para sitios con mucho JavaScript, usa el parámetro wait_before_scraping (2000-5000ms es típico). Esto asegura que el contenido dinámico esté completamente cargado.
Para sitios web populares (Amazon, LinkedIn, Google), usa nuestros parsers preconstruidos para obtener datos estructurados automáticamente.
Al usar extract_urls o crawl_website, usa patrones glob para enfocarte en páginas relevantes y evitar procesamiento innecesario.
Implementa retroceso exponencial para errores de límite de tasa. La API maneja automáticamente la mayoría de los límites de tasa internamente.

Soporte

Recursos Relacionados

Scrapes API

Aprende sobre el endpoint de Scrapes

Batches API

Aprende sobre el endpoint de Batches

Answers API

Aprende sobre el endpoint de Answers

Maps API

Aprende sobre el endpoint de Maps

Crawls API

Aprende sobre el endpoint de Crawls

Python SDK

Explora el SDK de Python

LangChain Website

Plataforma LangChain