📌 Google Scholar スクレイパーとは?
このテンプレートは、キーワードでGoogle Scholarを検索し、各検索結果を構造化された研究データに変換します。これには、タイトル、著者、出版年、説明、論文リンク、被引用数、関連記事リンク、利用可能な抄録が含まれます。手動で結果ページをコピーすることなく、繰り返し文献を発見する必要がある研究者、学生、図書館員、アナリスト、研究チームにとって便利です。
データはGoogle Scholarから収集されます。Google Scholarは、学術出版社、リポジトリ、大学、その他の研究ソースからの論文、学位論文、書籍、抄録、判例など、学術文献を対象とした検索サービスです。
💰 価格
このテンプレートは現在無料で、行ごとの使用料はかかりません。Octoparseのプランやリソースの制限が適用される場合があります。
📦 出力
現在公開されている実装では、以下のフィールドを返すことができます:
TitleAuthorPublished_yearDescriptionArticle_LinkCited_forAll_versionsRelated_articles_LinkCurrent_pageFull_Abstract
{
"Title": "Data mining in education",
"Author": "C Romero, S Ventura",
"Published_year": "2013",
"Description": "… The goal of text mining, also referred to as text data mining or text analytics, is to derive high-quality information from text. Typical text mining tasks include text categorization, text …",
"Article_Link": "https://wires.onlinelibrary.wiley.com/doi/abs/10.1002/widm.1075",
"Cited_for": "1347",
"All_versions": "5",
"Related_articles_Link": "https://scholar.google.com/scholar?q=related:M5gg5hmoDBcJ:scholar.google.com/&scioq=data+mining&hl=en&as_sdt=0,5",
"Current_page": null,
"Full_Abstract": null
}
🎯 使用例
- タイトル、著者、出版年、説明、論文リンクから文献レビュー用のデータセットを構築する。
- 被引用数と利用可能なバージョンを比較し、影響力のある、または広く配布されている研究を特定する。
- 繰り返しの研究スナップショットを通じて、あるトピックの検索状況がどのように変化するかを追跡する。
- 計量書誌学、学術トレンド、トピック分析のための読書リストや研究コーパスを作成する。
🐙 Octoparseを選ぶ理由
- すぐに使えるワークフロー: Google Scholarの抽出ステップはすでに設定済みなので、スクレイパーをゼロから構築する必要はありません。
- 柔軟な実行: サポートされているOctoparse環境で、既製のタスクをローカルで実行します。
- 構造化された反復可能な出力: 設定された同じフィールドが、手動でコピーしたページよりも比較、フィルタリング、重複排除、処理が容易な行として返されます。
- 入力のガードレール: 現在のフォームは、このテンプレートで必要とされる検証済みの入力と制限を公開しています。
- 実用的な引き渡し: Octoparseで結果を確認し、お使いのOctoparse環境でサポートされている形式で構造化データをエクスポートまたは処理します。
📝 入力
以下のフィールドを入力してください:
- Language (必須) — Google Scholarの検索言語を選択します。利用可能なオプション:한국어, 日本語, 中文 (繁體), Català, Čeština, Dansk, English, Français, Filipino, Hrvatski, Deutsch, Español, Indonesia, Latviešu, Magyar, Lietuvių, Italiano, Norsk, Polski, Português (Brasil), Português (Portugal), Nederlands, Română, Svenska, Slovenčina, Suomi, Tiếng Việt, Slovenščina, Türkçe, Ελληνικά, Български, Русский, עברית, ﺎﻠﻋﺮﺒﻳﺓ, ﻑﺍﺮﺳی, हिन्दी, Српски, ไทย, Українська.
- Keyword (必須) — Google Scholarで検索するためのキーワードのリストを入力します。1回の実行で最大10,000エントリまで。
🚀 使用方法
- テンプレートを開き、「Try it」または「Start」を選択します。
- 上記の入力フィールドをすべて入力します。
- サポートされているローカル実行モードを使用してタスクを開始します。
- 出力された行を確認し、構造化データをエクスポートまたは処理します。
⚠️ 制限事項
結果は、実行時にソースサイトが公開している内容に依存します。ソースページがその値を提供しない場合、リストされた出力フィールドは空になることがあります。上記の入力制限はテンプレートによって強制されます。
💡 ヒント
具体的で有効な入力を使用し、大規模なバッチを開始する前に代表的な結果を確認してください。繰り返しのレコードが不要な場合は、重複した入力を削除してください。
❓ よくある質問
このテンプレートはどのように機能しますか?
このテンプレートは、選択されたGoogle Scholarの言語を適用し、各キーワードを送信し、返された学術検索結果をループ処理し、設定されたフィールドを結果ごとに1つの構造化された行に抽出します。
何を入力する必要がありますか?
「入力」セクションに示されているフィールドと受け入れ可能な値を使用してください。ユーザーに関連する制限のみがリストされています。
このテンプレートはどのようなデータを返しますか?
現在の出力フィールドと代表的なJSONデータプレビューは、「出力」セクションにリストされています。ソースページに値が表示されない場合、フィールドの可用性は異なることがあります。
このテンプレートは無料で使用できますか?
このテンプレートは現在無料で、行ごとの使用料はかかりません。Octoparseのプランやリソースの制限が適用される場合があります。
なぜ一部の出力フィールドが空になることがあるのですか?
ソースページは、すべてのレコードに対してすべての値を常に公開しているわけではなく、ページレイアウトはアイテム、市場、または現在のサイトの応答によって異なる場合があります。現在のページがフィールドを提供している場合に、テンプレートはそれを返します。
収集したデータはエクスポートできますか?
Octoparseで構造化された行を確認し、お使いのOctoparse環境でサポートされているオプションを使用してエクスポートまたは処理することができます。
🔗 関連テンプレート
- Google Scholar Scraper (Cloud) — クラウドでの実行がワークフローに適している場合は、同じGoogle Scholarソースのクラウドバージョンを使用します。
- Google Scholar Scraper (Batch Generate URL) — Google Scholarの結果URLをバッチで生成または処理したい場合は、バッチURLワークフローを使用します。