Skip to main content

概要

OlostepのBatchesエンドポイントを使用すると、最大10,000のURLのバッチを開始し、5〜7分でコンテンツを取得できます。一度に最大10のバッチを開始して、100,000のURLから一度にコンテンツを抽出できます。さらにスケールが必要な場合は、お問い合わせください。 これは、すでに処理したいURLを持っている場合に便利です。例えば、データを集約して分析したり、専門的な検索ツールを構築したり、複数のウェブサイトの変化を監視したりする場合です。 このガイドでは、URLのリストを使ってバッチを開始し、マークダウン形式でコンテンツを取得する方法を説明します。

完全なコードのGist

Olostepでバッチスクレイピングを試すためにコピー&ペーストできるすべてのコードを1つのGistにまとめました: https://gist.github.com/olostep/e903f2e4fc28f8093b834b4df68b8031 このGistでは、5つのGoogle検索クエリでバッチを開始し、ステータスを確認し、各アイテムのコンテンツを取得する方法を示しています。

前提条件

始める前に、以下を確認してください:
  • 有効なOlostep APIキー。 Olostepにサインアップして取得できます。
  • システムにPythonがインストールされていること。
  • requestshashlibライブラリ(必要に応じてpip install requestsrequestsをインストール)。

ステップ1: ローカルURLからバッチを作成

すでに処理したいURLのリストがある場合は、スクリプト内で直接定義できます。そうでない場合は、ファイルやデータベースから読み取ることができます。

ステップ2: バッチステータスの監視

バッチが開始されたら、バッチを開始したときに返されるbatch_idを使用してそのステータスを監視できます。
バッチが完了するまで、数秒ごと(例:10秒ごと)にステータスをポーリングできます:

ステップ3: 完了したアイテムの取得

バッチが完了とマークされたら、処理されたアイテムを取得します。
各アイテムには、スクレイピングされたコンテンツを取得するためのretrieve_idが含まれています。

ステップ4: コンテンツの取得

retrieve_idを使用して、マークダウン、HTML、またはJSON形式で抽出されたコンテンツを取得します。ここでは、マークダウン形式でコンテンツを取得する例を示します:

ホストされたコンテンツ

コンテンツは7日間ホストされるため、再スクレイピングせずに複数回取得できます。 マークダウンコンテンツのホストされたURLの例

使用例

1. 検索エンジンの構築

Olostepを使用して、業界特化型のウェブサイト(法律、医療、AI)からコンテンツを抽出し、検索可能なデータベースを構築します。

2. ウェブサイトの監視

製品の在庫状況、価格の変動、ニュースの更新を複数のウェブサイトで監視し、日々のバッチスクレイプをスケジュールします。

3. ソーシャルメディアの監視

フォーラムやコンテンツソースでブランドやキーワードの言及をスクレイピングし、構造化データを抽出します。

4. アグリゲーター

求人ボード、ニュースアグリゲーター、不動産リスティングプラットフォームを構築し、数十のソースからデータを取得します。

結論

バッチスクレイピングを使用すると、最大100kのURLから迅速かつ効率的にコンテンツを抽出できます。検索ツール、アグリゲーター、監視システムを構築する場合でも、Olostep Batchesはその作業を簡素化します。 構造化データのみを抽出したいですか? 必要なフィールドだけを取得するには、Parsersを使用してください。サポートが必要ですか? info@olostep.comまでご連絡いただければ、カスタムスクリプトの作成もお手伝いします。