📌 IMDbから収集できるレビューデータ
このテンプレートは、タイトル、レビュータイトル、ユーザー名、ページURL、パーマリンク、評価、評価数、レビュー評価を含むレビューレコードを収集します。これは、顧客インサイトチーム、評判分析者、研究者、競合情報専門家にとって有用です。
データはIMDbから収集されます。IMDbは、映画、テレビ、キャストとクルーの情報、評価、ユーザーレビューのデータベースです。
💰 価格
このテンプレートは現在無料で、行ごとの使用料はありません。Octoparseのプランやリソースの制限が適用される場合があります。
📦 出力
現在公開されている実装では、以下のフィールドを返すことができます:
TitleRatingRating_CountPlotPage_URLPublished_YearLengthDirectorWritersStarsReview_RatingReview_CountUser_NameReview_DateReview_TitlePremalinkReview_TextHelpful_CountDislike_Count
{
"Title": "ハリー・ポッターと賢者の石",
"Rating": "7.7 /10",
"Rating_Count": "885K",
"Plot": "孤児の少年が魔法学校に入学し、そこで自分自身、家族、そして魔法界を悩ます恐ろしい悪についての真実を学びます。孤児の少年が魔法学校に入学し、そこで自分自身、家族、そして魔法界を悩ます恐ろしい悪についての真実を学びます。孤児の少年が魔法学校に入学し、そこで自分自身、家族、そして魔法界を悩ます恐ろしい悪についての真実を学びます。",
"Page_URL": "https://www.imdb.com/title/tt0241527/?ref_=tt_urv",
"Published_Year": "2001",
"Length": "2h 32m",
"Director": "Chris Columbus",
"Writers": "J.K. RowlingSteve Kloves",
"Stars": "Daniel RadcliffeRupert GrintEmma Watson",
"Review_Rating": "8 /10",
"Review_Count": "2,046件のレビュー",
"User_Name": "Keyan-the-Eagle144",
"Review_Date": "2018/03/23",
"Review_Title": "すべての魔法の偉大な始まり!",
"Premalink": "https://www.imdb.com/review/rw4101904/?ref_=tturv_perm_1",
"Review_Text": "2001年以前にハリー・ポッターの最初の数冊を読んでいて、最初の映画の誇大広告を聞いて、私は興奮していました。全員イギリス人のキャストになると聞いて(理にかなっていますよね?)、私たちの世代を代表する小説の一つを実写版で見ることができると。覚えている限りでは、クリスマスの翌日に家族と友人と一緒に映画を見に行き、心地よく驚かされました。映画が終わった後、クレジットを見て、いくつか見覚えのある名前(故アラン・リックマン、『天使にラブ・ソングを…』のマギー・スミス、『007』のロビー・コルトレーン、『スター・ウォーズ』のワーウィック・デイヴィス)を見つけました。他はあまり馴染みのない名前でした(子供たち、中にはデビュー作の人もいました)。しかし、それは良い映画で、誰もが見るべき色彩と光景の饗宴でした。これは間違いなく、すべてのハリー・ポッター映画の中で私のお気に入りです。この映画シリーズの起爆剤です!",
"Helpful_Count": "83",
"Dislike_Count": "13"
}
🎯 使用例
- タイトル、レビュータイトル、ユーザー名で整理された構造化されたIMDbレビューデータセットを構築します。
- 収集したレコード間で、評価、評価数、レビュー評価、レビュー数を比較します。
- レビューテキストを通じてレビュー内容を、レビュー日付を通じてレビューのタイミングを分析します。
- 低評価数と役に立った数を使用して、オーディエンスの反応を測定します。
🐙 Octoparseを選ぶ理由
- すぐに使えるワークフロー: IMDbの抽出ステップはすでに設定済みなので、スクレイパーをゼロから構築する必要はありません。
- 柔軟な実行: サポートされているローカルまたはクラウドの実行モードを選択して、一度限りのチェックや繰り返し行う収集作業に合わせることができます。
- 構造化された再現可能な出力: 結果は一貫した行として返されるため、手動でコピーしたページよりも比較、フィルタリング、重複排除、処理が容易です。
- 検証済みの入力ガードレール: フォームには、このテンプレート用に設定された現在の入力、選択可能な値、および意味のある制限が表示されます。
- 実用的なデータハンドオフ: Octoparseで結果を確認し、お使いのOctoparse環境でサポートされているオプションを使用してエクスポートまたは処理します。
📝 入力
以下のフィールドを入力してください:
- URL (必須) — レビューを抽出するための映画のURLリストを入力します。1回の実行につき最大50,000エントリ。
🚀 使用方法
- テンプレートを開き、試用または開始を選択します。
- 上記の入力フィールドをすべて入力します。
- サポートされているローカルまたはクラウドの実行モードを使用してタスクを開始します。
- 出力された行を確認し、構造化されたデータをエクスポートまたは処理します。
⚠️ 制限事項
結果は、実行時にソースサイトが公開している内容に依存します。ソースページが値を提供しない場合、リストされている出力フィールドは空になることがあります。上記の入力制限は、テンプレートによって強制されます。
💡 ヒント
大規模なバッチを開始する前に、具体的で有効な入力を使用し、代表的な結果を確認してください。繰り返しレコードが不要な場合は、重複した入力を削除してください。
❓ よくある質問
このスクレイパーはどのように機能しますか?
この自動化は、URLを通じて提供された各ページ(1回の実行につき最大50,000)を開き、設定された制御に従って利用可能なレビューコンテンツを移動し、タイトル、評価、評価数、あらすじを含む構造化されたレビュー行を書き出します。
何を入力する必要がありますか?
「入力」セクションに示されているフィールドと受け入れ可能な値を使用してください。ユーザーに関連する制限と選択可能なオプションのみがリストされています。
このテンプレートはどのようなデータを返しますか?
現在の出力フィールドと代表的なJSONデータプレビューは、「出力」セクションにリストされています。ソースページが値を表示しない場合、フィールドの可用性は異なることがあります。
このテンプレートは無料で使用できますか?
現在無料で、行ごとの使用料はありません。Octoparseのプランやリソースの制限が適用される場合があります。
なぜ一部の出力フィールドが空になることがあるのですか?
ソースページは、すべてのレコードのすべての値を常に公開しているわけではなく、レイアウトはアイテム、市場、または現在のサイトの応答によって異なる場合があります。テンプレートは、現在のページがフィールドを提供している場合にそのフィールドを返します。
収集したデータをエクスポートできますか?
Octoparseで構造化された行を確認し、お使いのOctoparse環境でサポートされているオプションを使用してエクスポートまたは処理することができます。
🔗 関連テンプレート
- Goodreads Comments Scraper — 書籍に焦点を当てた補完的なオーディエンスレビューワークフローには、Goodreads Comments Scraperを使用してください。
- YouTube Comments & Replies Scraper — ビデオコンテンツに対するオーディエンスの反応を調査するには、YouTube Comments & Replies Scraperを使用してください。