特徴
この統合は、Olostep APIのすべての5つの機能にアクセスできます:スクレイプ
任意の単一URLから複数の形式(Markdown、HTML、JSON、テキスト)でコンテンツを抽出
バッチ
最大10,000のURLを並行して処理。バッチジョブは5-8分で完了
回答
自然言語クエリと構造化出力を備えたAI駆動のウェブ検索
マップ
サイト構造分析のためにウェブサイトからすべてのURLを抽出
クロール
リンクをたどってウェブサイト全体を自動的に発見しスクレイプ
インストール
セットアップ
Olostep APIキーを環境変数として設定します:利用可能なツール
scrape_website
単一のURLからコンテンツを抽出します。複数の形式とJavaScriptレンダリングをサポート。string
必須
スクレイプするウェブサイトのURL(http://またはhttps://を含む必要があります)
string
デフォルト:"markdown"
出力形式:
markdown、html、json、またはtextstring
ロケーション固有のコンテンツのための国コード(例:“US”、“GB”、“CA”)
integer
JavaScriptレンダリングの待機時間(ミリ秒単位、0-10000)
string
特殊な抽出のためのオプションのパーサーID(例:“@olostep/amazon-product”)
scrape_batch
複数のURLを並行して処理(最大10,000件まで一度に)。array
必須
スクレイプするURLのリスト
string
デフォルト:"markdown"
すべてのURLの出力形式:
markdown、html、json、またはtextstring
ロケーション固有のコンテンツのための国コード
integer
JavaScriptレンダリングの待機時間
string
特殊な抽出のためのオプションのパーサーID
answer_question
ウェブを検索し、ソース付きのAI駆動の回答を取得。データ強化や調査に最適。string
必須
検索する質問またはタスク
object
望ましい出力形式を記述するオプションのJSONスキーマ辞書/文字列
extract_urls
サイト構造分析のためにウェブサイトからすべてのURLを抽出。string
必須
URLを抽出するウェブサイトのURL
string
URLをフィルタリングするためのオプションの検索クエリ
integer
返されるURLの数を制限
array
含めるグロブパターン(例:[“/blog/**”])
array
除外するグロブパターン(例:[“/admin/**”])
crawl_website
リンクをたどってウェブサイト全体を自動的に発見しスクレイプ。string
必須
クロールの開始URL
integer
デフォルト:"100"
クロールする最大ページ数
array
含めるグロブパターン(例:[”/**“]で全て)
array
除外するグロブパターン(例:[“/admin/**”])
integer
start_urlからクロールする最大深度
boolean
デフォルト:"false"
外部URLを含める
LangChainエージェント統合
ウェブを検索しスクレイプできるインテリジェントなエージェントを構築:LangGraph統合
LangGraphで複雑なマルチステップワークフローを構築:高度なユースケース
データ強化
スプレッドシートデータをウェブ情報で強化:Eコマース製品スクレイピング
特殊なパーサーで製品データをスクレイプ:SEO監査
SEOのためにウェブサイト全体を分析:ドキュメントスクレイピング
ドキュメントをクロールして抽出:専門パーサー
Olostepは人気のあるウェブサイト向けの事前構築されたパーサーを提供:@olostep/google-search- Google検索結果
parserパラメータで使用:
エラーハンドリング
ベストプラクティス
複数のURLに対してバッチ処理を使用
複数のURLに対してバッチ処理を使用
3-5以上のURLをスクレイプする場合は、複数の
scrape_website呼び出しの代わりにscrape_batchを使用してください。バッチ処理ははるかに高速でコスト効率が高いです。適切なタイムアウトを設定
適切なタイムアウトを設定
JavaScriptが多用されているサイトの場合、
wait_before_scrapingパラメータを使用してください(2000-5000msが一般的)。これにより、動的コンテンツが完全に読み込まれます。専門パーサーを使用
専門パーサーを使用
人気のあるウェブサイト(Amazon、LinkedIn、Google)については、事前構築されたパーサーを使用して自動的に構造化データを取得してください。
効率的にURLをフィルタリング
効率的にURLをフィルタリング
extract_urlsまたはcrawl_websiteを使用する際は、グロブパターンを使用して関連するページに焦点を当て、不要な処理を避けてください。レート制限を処理
レート制限を処理
レート制限エラーに対して指数バックオフを実装してください。APIは内部でほとんどのレート制限を自動的に処理します。
サポート
- PyPIパッケージ: langchain-olostep
- ドキュメント: docs.olostep.com
- 問題: GitHub Issues
- メール: info@olostep.com
関連リソース
Scrapes API
Scrapesエンドポイントについて学ぶ
Batches API
Batchesエンドポイントについて学ぶ
Answers API
Answersエンドポイントについて学ぶ
Maps API
Mapsエンドポイントについて学ぶ
Crawls API
Crawlsエンドポイントについて学ぶ
Python SDK
Python SDKを探索
LangChain Website
LangChainプラットフォーム