Skip to main content

概述

与其映射整个网站,你可能更想专注于特定部分。在本指南中,我们将向你展示如何仅从Stripe网站提取博客URL。

仅提取博客URL

要从Stripe网站仅提取博客URL,请使用带有路径模式过滤器的maps端点。include_urls参数允许你指定想要在结果中包含的URL模式。

理解URL模式

在上面的例子中,我们使用了两个模式规范:
  • /blog - 精确匹配主博客页面 (https://stripe.com/blog)
  • /blog/** - 匹配/blog下的所有子路径,包括单个博客文章、分类页面等。
这种组合确保我们捕获所有与博客相关的内容,同时排除网站的其他部分。

示例响应

按类别过滤博客URL

你可以进一步细化提取,专注于特定的博客类别。例如,如果你只对Stripe的工程博客文章感兴趣:

下一步

现在你已经提取了所有Stripe的博客URL,
  1. 你可以使用scrape API单独获取它们的内容。
  2. 或者,使用下一个指南直接抓取并提取这些博客页面的实际内容,使用内置过滤器。