📌 事前に生成されたGoogle Scholarの検索結果URLから収集できる学術検索データとは?
このテンプレートは、送信されたGoogle ScholarのURLから学術検索結果のレコードを収集します。収集するデータには、タイトル、著者、出版年、説明、論文リンク、被引用数、バージョン数、関連記事リンク、現在のページ、および利用可能な場合は完全な抄録が含まれます。学術研究者、図書館員、リサーチインテリジェンスチームにとって有用です。
データはGoogle Scholarから収集されます。Google Scholarは、学術文献、引用、著者、および関連研究のための学術検索サービスです。
💰 価格
このテンプレートは現在無料で、行ごとの使用料はかかりません。Octoparseのプランやリソースの制限が適用される場合があります。
📦 出力
現在公開されている実装では、以下のフィールドを返すことができます:
Page_URLCurrent_pageTitleAuthorPublished_yearDescriptionArticle_LinkCited_forAll_versionsRelated_articles_LinkFull_Abstract
{
"Page_URL": null,
"Current_page": null,
"Title": "Data mining in education",
"Author": "C Romero, S Ventura",
"Published_year": "2013",
"Description": "… The goal of text mining, also referred to as text data mining or text analytics, is to derive high-quality information from text. Typical text mining tasks include text categorization, text …",
"Article_Link": "https://wires.onlinelibrary.wiley.com/doi/abs/10.1002/widm.1075",
"Cited_for": "1347",
"All_versions": "5",
"Related_articles_Link": "https://scholar.google.com/scholar?q=related:M5gg5hmoDBcJ:scholar.google.com/&scioq=data+mining&hl=en&as_sdt=0,5",
"Full_Abstract": null
}
🎯 使用例
- タイトル、著者、年、論文リンクから文献レビュー用のデータセットを構築します。
- 被引用数とバージョン数を用いて学術的な影響力を比較します。
- 説明と完全な抄録を用いて、論文の関連性をスクリーニングします。
- 関連記事リンクを用いて、関連研究をマッピングします。
🐙 Octoparseを選ぶ理由
- すぐに使えるワークフロー: Google Scholarの抽出ステップはすでに設定済みのため、スクレイパーをゼロから構築する必要はありません。
- 柔軟な実行: サポートされているローカルまたはクラウドの実行モードを選択して、一度限りのチェックや繰り返し行う収集作業に合わせることができます。
- 構造化された再現可能な出力: 結果は一貫した行として返されるため、手動でコピーしたページよりも比較、フィルタリング、重複排除、処理が容易です。
- 検証済みの入力ガードレール: フォームには、このテンプレート用に設定された現在の入力、選択可能な値、および意味のある制限が表示されます。
- 実用的なデータハンドオフ: Octoparseで結果を確認し、お使いのOctoparse環境でサポートされているオプションを使用してエクスポートまたは処理します。
📝 入力
以下のフィールドを入力してください:
- オフセット付きGoogle Scholar検索結果URL (必須) — オフセットを含むGoogle Scholarの検索結果URLを入力します。多数のオフセットURLを作成する必要がある場合は、一括URL生成ツールを使用してください。1回の実行で最大1,000,000エントリまで。
🚀 使用方法
- テンプレートを開き、試すまたは開始を選択します。
- 上記の入力フィールドをすべて入力します。
- サポートされているローカルまたはクラウドの実行モードを使用してタスクを開始します。
- 出力された行を確認し、構造化されたデータをエクスポートまたは処理します。
⚠️ 制限事項
結果は、実行時にソースサイトが公開している内容に依存します。ソースページが値を提供しない場合、リストされている出力フィールドは空になることがあります。上記に示されている入力制限は、テンプレートによって強制されます。
💡 ヒント
大規模なバッチを開始する前に、具体的で有効な入力を使用し、代表的な結果を確認してください。繰り返しレコードが不要な場合は、重複した入力を削除してください。
❓ よくある質問
このスクレイパーはどのように機能しますか?
この自動化は、送信された各Google Scholar検索結果URLを既存のオフセットで開き、結果レコードをループ処理し、必要に応じて利用可能な抄録ルートにアクセスし、設定された学術フィールドをエクスポートします。
何を入力する必要がありますか?
「入力」セクションに示されているフィールドと受け入れ可能な値を使用してください。ユーザーに関連する制限と選択可能なオプションのみがリストされています。
このテンプレートはどのようなデータを返しますか?
現在の出力フィールドと代表的なJSONのデータプレビューは、「出力」セクションにリストされています。ソースページが値を表示しない場合、フィールドの可用性は異なることがあります。
このテンプレートは無料で使用できますか?
現在無料で、行ごとの使用料はかかりません。Octoparseのプランやリソースの制限が適用される場合があります。
なぜ一部の出力フィールドが空になることがあるのですか?
ソースページは、すべてのレコードのすべての値を常に公開しているわけではなく、レイアウトはアイテム、市場、または現在のサイトの応答によって異なる場合があります。テンプレートは、現在のページがフィールドを提供している場合にそのフィールドを返します。
収集したデータはエクスポートできますか?
Octoparseで構造化された行を確認し、お使いのOctoparse環境でサポートされているオプションを使用してエクスポートまたは処理することができます。
🔗 関連テンプレート
- Google Scholar Scraper — キーワードから直接Google Scholarの検索結果を収集します。
- Google Scholar Scraper (Cloud) — キーワードベースの出版物と抄録の収集には、クラウドのGoogle Scholarワークフローを使用します。
- Microsoft Research Scraper — Microsoft Researchからの出版物データで学術的発見を拡張します。