Skip to main content
POST
启动网页抓取
可选缓存: 传递 max_age(以秒为单位)以重用具有相同参数的最近抓取,而不是再次获取页面。默认值为 0(始终最新)。在仪表板游乐场中,默认值为24小时。详情请参见缓存

授权

Authorization
string
header
必填

Bearer认证头格式为Bearer ,其中是你的认证令牌。

请求体

application/json
url_to_scrape
string<uri>
必填

开始抓取的URL。

wait_before_scraping
integer

在开始抓取之前等待的时间,以毫秒为单位。

formats
enum<string>[]

你想要内容的格式。

可用选项:
html,
markdown,
text,
json,
raw_pdf,
screenshot
remove_css_selectors
enum<string>

选择从内容中移除某些CSS选择器。你也可以传递一个JSON字符串化的数组,指定你想要移除的特定选择器。当此选项设置为默认时,移除的CSS选择器为 ['nav','footer','script','style','noscript','svg',[role=alert],[role=banner],[role=dialog],[role=alertdialog],[role=region][aria-label*=skip i],[aria-modal=true]]

可用选项:
default,
none,
array
actions
(等待 · object | 点击 · object | 填写输入 · object | 滚动 · object)[]

在获取内容之前对页面执行的操作。

country
string

加载请求的住宅国家。 支持的值有: - US (United States) - CA (Canada) - IT (Italy) - IN (India) - GB (England) - JP (Japan) - MX (Mexico) - AU (Australia) - ID (Indonesia) - UA (UAE) - RU (Russia) - RANDOM 一些操作,如抓取Google搜索和Google新闻,支持所有国家。

transformer
enum<string>

指定要使用的HTML转换器(如果有)。使用Postlight的Mercury Parser库来移除广告和其他不需要的内容。

可用选项:
postlight,
none
remove_images
boolean
默认值:false

选择从抓取的内容中移除图像。默认为false。

remove_class_names
string[]

要从内容中移除的类名列表。

parser
object

当定义json作为格式时,你可以使用此参数指定要使用的解析器。解析器对于从网页中提取结构化内容非常有用。Olostep为大多数常见网页内置了一些解析器,你也可以创建自己的解析器。

llm_extract
object

使用此选项,你可以获取你抓取的页面上存在的所有链接。链接始终以绝对URL返回。

screen_size
object

屏幕尺寸配置。通过 screen_type 可用的预设尺寸有:desktop (1920x1080)、mobile (414x896) 或 default (768x1024)。

screenshot
object
metadata
object

用户定义的元数据。尚不支持。

max_age
integer
默认值:0

缓存内容的最大可接受年龄,以秒为单位。当已存在的抓取匹配并且比 max_age 秒更新时,Olostep 返回存储的结果,而不是启动新的浏览器抓取。默认值为 0(始终抓取最新)。在仪表板游乐场中,默认值为 86400(24 小时)。允许的最大值为 604800(7 天)。有关详细信息,请参阅抓取功能文档中的缓存部分。

必填范围: x >= 0

响应

成功响应,包含抓取启动的详细信息。

id
string

抓取 ID

object
string

对象的种类。此端点为 "scrape"。

created
number

创建的纪元时间

metadata
object

用户定义的元数据。

url_to_scrape
string

被抓取的 URL。

result
object
credits_consumed
integer | null

此请求消耗的积分数量。在执行完成后填充。积分是计费的真实来源。

cost_usd
number | null

此请求的估计成本(以美元计)。在执行完成后填充。根据消耗的积分和你的计划费率计算——99% 准确,但 credits_consumed 是权威值。