功能
该集成提供对所有 5 种 Olostep API 功能的访问:抓取
从任何单一 URL 提取内容,支持多种格式(Markdown、HTML、JSON、文本)
批处理
并行处理多达 10,000 个 URL。批处理作业在 5-8 分钟内完成
答案
支持自然语言查询和结构化输出的 AI 驱动网页搜索
地图
提取网站的所有 URL 以进行站点结构分析
爬取
通过跟随链接自主发现并抓取整个网站
安装
设置
将你的 Olostep API 密钥设置为环境变量:可用工具
scrape_website
从单一 URL 提取内容。支持多种格式和 JavaScript 渲染。string
必填
要抓取的网站 URL(必须包括 http:// 或 https://)
string
默认值:"markdown"
输出格式:
markdown、html、json 或 textstring
用于特定位置内容的国家代码(例如,“US”、“GB”、“CA”)
integer
JavaScript 渲染的等待时间(0-10000 毫秒)
string
用于专门提取的可选解析器 ID(例如,“@olostep/amazon-product”)
scrape_batch
并行处理多个 URL(一次最多 10,000 个)。array
必填
要抓取的 URL 列表
string
默认值:"markdown"
所有 URL 的输出格式:
markdown、html、json 或 textstring
用于特定位置内容的国家代码
integer
JavaScript 渲染的等待时间
string
用于专门提取的可选解析器 ID
answer_question
搜索网络并获取带有来源的 AI 驱动答案。非常适合数据丰富和研究。string
必填
要搜索的问题或任务
object
描述所需输出格式的可选 JSON 架构字典/字符串
extract_urls
提取网站的所有 URL 以进行站点结构分析。string
必填
要从中提取 URL 的网站 URL
string
用于过滤 URL 的可选搜索查询
integer
限制返回的 URL 数量
array
要包含的全局模式(例如,[“/blog/**”])
array
要排除的全局模式(例如,[“/admin/**”])
crawl_website
通过跟随链接自主发现并抓取整个网站。string
必填
爬取的起始 URL
integer
默认值:"100"
要爬取的最大页面数
array
要包含的全局模式(例如,[”/**”] 表示全部)
array
要排除的全局模式(例如,[“/admin/**”])
integer
从 start_url 开始的最大爬取深度
boolean
默认值:"false"
包括外部 URL
LangChain 代理集成
构建可以搜索和抓取网络的智能代理:LangGraph 集成
使用 LangGraph 构建复杂的多步骤工作流:高级用例
数据丰富
使用网络信息丰富电子表格数据:电商产品抓取
使用专门的解析器抓取产品数据:SEO 审核
分析整个网站的 SEO:文档抓取
爬取并提取文档:专门解析器
Olostep 提供了针对热门网站的预构建解析器:@olostep/google-search- Google 搜索结果
parser 参数中使用它们:
错误处理
最佳实践
使用批处理处理多个 URL
使用批处理处理多个 URL
当抓取超过 3-5 个 URL 时,使用
scrape_batch 而不是多个 scrape_website 调用。批处理速度更快且更具成本效益。设置适当的超时时间
设置适当的超时时间
对于 JavaScript 密集型网站,使用
wait_before_scraping 参数(通常为 2000-5000 毫秒)。这确保动态内容完全加载。使用专门解析器
使用专门解析器
对于热门网站(如亚马逊、LinkedIn、Google),使用我们的预构建解析器自动获取结构化数据。
高效过滤 URL
高效过滤 URL
使用
extract_urls 或 crawl_website 时,使用全局模式专注于相关页面,避免不必要的处理。处理速率限制
处理速率限制
对于速率限制错误,实施指数退避。API 会自动处理大多数速率限制。
支持
- PyPI 包: langchain-olostep
- 文档: docs.olostep.com
- 问题: GitHub Issues
- 电子邮件: info@olostep.com
相关资源
抓取 API
了解抓取端点
批处理 API
了解批处理端点
答案 API
了解答案端点
地图 API
了解地图端点
爬取 API
了解爬取端点
Python SDK
探索 Python SDK
LangChain 网站
LangChain 平台