📌 1つのクローラーで複数の公開ウェブサイトから構造化されたコンテンツを抽出する方法は?
このテンプレートは、設定されたクロール深度、ページ制限、除外ルールに従い、ユーザーが提供した公開ウェブサイトから構造化されたページコンテンツとページメタデータを収集します。コンテンツリサーチャー、ナレッジベースチーム、データ運用チームにとって便利です。
データはユーザーが提供した公開ウェブサイトから収集されます。このテンプレートは単一のソースウェブサイトに限定されません。ユーザーが提供した公開ウェブサイトのURLから開始し、設定されたクロール範囲内のページコンテンツを抽出します。
💰 価格
このテンプレートは現在無料で、行ごとの使用料はかかりません。Octoparseのプランやリソース制限が適用される場合があります。
📦 出力
現在公開されている実装では、以下のフィールドを返すことができます:
msg_typecontenturltitleauthorpublished_atformaterror_message
{
"msg_type": null,
"content": "{\"text\": \"Eighty feet below the streets of Manhattan...\"}",
"url": "https://www.bloomberg.com/opinion/articles/...",
"title": "Why Is Germany Sitting on $599 Billion of Gold?",
"author": "Chris Bryant",
"published_at": "2026-01-29",
"format": "json",
"error_message": null
}
🎯 使用例
- ページのURL、タイトル、著者、公開時刻を使用してコンテンツアーカイブを作成します。
- 選択した形式を使用して、下流の分析のためにウェブサイトのコンテンツを準備します。
- 深度、ページ制限、除外制御を使用して、限定されたサイトセクションをクロールします。
- URLとエラーメッセージフィールドを使用して、アクセスできないページを監査します。
🐙 Octoparseを選ぶ理由
- すぐに使えるワークフロー: ユーザーが提供した公開ウェブサイトからの抽出ステップはすでに設定済みなので、スクレイパーをゼロから構築する必要はありません。
- 柔軟な実行: 収集のためにローカルコンピュータをオンラインに保つことなく、クラウドで既製のタスクを実行できます。
- 構造化され、再現可能な出力: 結果は一貫した行として返されるため、手動でコピーしたページよりも比較、フィルタリング、重複排除、処理が容易です。
- 検証済みの入力ガードレール: フォームには、このテンプレート用に設定された現在の入力、選択可能な値、および意味のある制限が表示されます。
- 実用的なデータハンドオフ: Octoparseで結果を確認し、お使いのOctoparse環境でサポートされているオプションを使用してエクスポートまたは処理します。
📝 入力
以下のフィールドを入力してください:
- ウェブサイトURL (必須) — クロールを開始する公開ウェブサイトのURLを入力します。1回の実行につき最大10,000件まで。
- 最大クロール深度 (任意) — 各開始URLからクローラーがたどるリンクレベルの数を設定します。空白のままにすると、クロール深度0が使用されます。許容範囲:0~5。
- URLごとの最大ページ数 (任意) — 各開始URLから収集する最大ページ数を設定します。空白のままにすると、10ページが使用されます。許容範囲:1~1000。
- フォーマット (任意)
- Exclude_Glob (任意) — クロールから除外するURLまたはパスのglobパターンを入力します。
- Output_Field_Name (任意)
🚀 使用方法
- テンプレートを開き、試すまたは開始を選択します。
- 上記の入力フィールドをすべて入力します。
- サポートされているクラウド実行モードを使用してタスクを開始します。
- 出力された行を確認し、構造化されたデータをエクスポートまたは処理します。
⚠️ 制限事項
結果は、実行時にソースサイトが公開している内容に依存します。ソースページが値を提供しない場合、リストされている出力フィールドは空になることがあります。上記の入力制限はテンプレートによって強制されます。
💡 ヒント
大規模なバッチを開始する前に、具体的で有効な入力を使用し、代表的な結果を確認してください。繰り返しレコードが不要な場合は、重複した入力を削除してください。
❓ よくある質問
Octoparseはどのようにしてユーザーが提供した公開ウェブサイトからデータを収集しますか?
Pythonオートメーションは、送信された各ウェブサイトURLから開始し、設定された深度とページ制限内で適格なリンクをたどり、提供されたglobに一致するリンクを除外し、ページコンテンツを選択された形式に変換し、処理されたページごとに1つのレコードをアップロードします。
このユニバーサルコンテンツスクレイパーにはどのような入力が必要ですか?
入力セクションに示されているフィールドと許容値を使用してください。ユーザーに関連する制限と選択可能なオプションのみがリストされています。
ユーザーが提供した公開ウェブサイトからどのようなデータを抽出できますか?
現在の出力フィールドと代表的なJSONのデータプレビューは、出力セクションにリストされています。ソースページに値が表示されない場合、フィールドの可用性は異なることがあります。
このユニバーサルコンテンツスクレイパーは無料で使用できますか?
現在無料で、行ごとの使用料はかかりません。Octoparseのプランやリソース制限が適用される場合があります。
ユーザーが提供した公開ウェブサイトのフィールドが空になることがあるのはなぜですか?
ソースページは、すべてのレコードに対してすべての値を常に公開しているわけではなく、レイアウトはアイテム、市場、または現在のサイトの応答によって異なる場合があります。テンプレートは、現在のページがフィールドを提供する場合にそれを返します。
収集したユーザー提供の公開ウェブサイトのデータをエクスポートできますか?
Octoparseで構造化された行を確認し、お使いのOctoparse環境でサポートされているオプションを使用してエクスポートまたは処理することができます。
🔗 関連テンプレート
- AI Crawl — ウェブサイトがより広範な複数ページのクロールを必要とする場合に、AIガイドのスコープとフィルターを使用します。
- AI Scraper — 正確なターゲットページのURLがすでにわかっている場合に、カスタムフィールドを抽出します。
- Google Search Scraper — Googleの検索結果URLを使用して、コンテンツ抽出のための公開ウェブサイトやページを特定します。