Reddit コメントスクレイパー

投稿を指定して、
スレッドごと手元に。

Reddit の投稿 URL を貼り付けると、そのコメントが表として返ります。誰が書いたか、コメント本文そのもの、スコア、投稿された日時、そこへ直接たどれるリンク、そしてステータス列。7 列、1 コメント 1 行、6 通りの並び順からお選びいただけます。

500 行無料、初回のみ以降は 1 行 0.002 ドル7 列CSV · XLSX · JSON
使い方

投稿 URL を入れれば、
スレッドが出る

投稿と並び順はあなたが選びます。ジョブはそれぞれの投稿のコメントを読み、返ってきたコメントごとに 1 行を書き出します。

  1. ステップ 1プラットフォームにログインします。
  2. ステップ 2Reddit コメントスクレイパーを開きます。
  3. ステップ 3Reddit の投稿 URL を 1 行に 1 件ずつ貼り付けます。CSV・XLSX・TXT・Parquet ファイルをアップロードしてもかまいません。
  4. ステップ 4並び順を選びます。Best、Top、New、Controversial、Old、Q&A のいずれかです。
  5. ステップ 5クエリごとの上限を設定します。すべて取得する場合は空欄のままにします。
  6. ステップ 6出力形式を選び、Get Data をクリックします。

1 コメント 1 行で、どの行にも取得元の投稿 URL が付きます。この点はここでは特に重要です。コメントをスレッドに結び付ける列がほかにないからです。

チームが使う理由

コメントの件数ではなく、
本文そのもの

実際に書かれた内容

コメント本文を返すのがこのサービスです。対になる Reddit 検索スクレイパーには comments という列がありますが、あれは投稿が持つコメントの件数、つまり数字です。数ではなく文章がほしいならこちらで、2 つは続けて実行することを想定して作られています。

6 通りの並び順、肝心なものも揃って

Best、Top、New、Controversial、Old、Q&A。クエリごとに行数を絞るなら、並び順は飾りではありません。上限と Top の組み合わせはスレッドが賛同したコメントを、同じ上限と Controversial の組み合わせは論争そのものを返します。上限を決めた後ではなく、上限を念頭に置いて並び順を選んでください。

どの行も自分自身へのリンクを持つ

各コメントは投稿のリンクだけでなく、自分自身のパーマリンクを持っています。だからこそ数か月後でもエクスポートを検証できます。レポート中の引用は、その出どころのコメントまで正確にたどれ、確認する人はスレッドを手作業で探さずに開けます。

取得できる内容

7 列、
1 コメント 1 行

各行は 1 件のコメントです。誰が書いたか、何と書いてあるか、どう評価されたか、いつ現れたか、どこにあるか、そして取得がどう進んだか。

このエクスポートを前提に設計する前に知っておきたいことが 2 つあり、どちらも実行結果ではなくスキーマの形から導かれます。1 つ目はフラットであること。親 ID もコメント ID も深さの列もないので、得られるのはコメントの一覧であって返信ツリーではありません。query だけが行をスレッドに結び付けるものであり、だからこそ残しておく価値があります。2 つ目は status が飾りではなく実用の列だということです。下の列一覧はプラットフォームが公開している配列で、アーカイブ済み実行のヘッダーと突き合わせてあります。パーサーを書く前にその下の注記をお読みください。このページが何を伝え、何を伝えないかを率直に書いてあります。

データ辞書

7 列、
エクスポート順

エクスポートのヘッダー行を順序どおりに、プラットフォームが公開する列一覧と照合したものです。説明は各項目が何のためのものかを述べます。書式や、どれくらいの頻度で値が入るかについては何も主張しません - 下の注記をご覧ください。

query
送信した Reddit の投稿 URL で、そこから得られたすべての行に繰り返されます。ページから取るのではなくスクレイパーが書き込むため、どの行にも入っています。そしてこのエクスポートでは通常以上に重い列です。コメントがどのスレッドに属するかを示すものが、ほかにないからです。
author
コメントを書いた Reddit アカウント。本名ではなくユーザー名ですが、それでも人です。このページの下にある個人データについての記述をご覧ください。
body
コメントの本文。検索サービスの comments フィールドが書かれた内容ではなく件数であるのに対し、このサービスを分けているのがこの列です。
score
Reddit が表示するコメントのスコア。受け取った投票の差し引きです。
created
コメントが投稿された日時。手元のどの実行でも値が返っていないため、このページでは形式をお伝えしません。パースする前に、ご自身の実行の最初の数行をご確認ください。
permalink
投稿ではなく、個々のコメントへのリンク。引用を手作業で確かめる必要が生じたときや、レポートで出典として示すときのために残しておきたい列です。
status
その行の取得がどう進んだか。飾りではなく実用の列で、行が中身なしで返ってきたときは、ここに理由が入ります。その投稿に単にコメントがなかったのだと結論づける前に、この列を読んでください。

この辞書は名前の一覧として読んでください。中身についての約束ではありません。7 つの名前とその順序は確かです。プラットフォームが公開している列一覧と、アーカイブ済み実行のヘッダー行が正確に一致しています。定まっていないのはそこに何が入るかで、中身の入った Reddit Comments のエクスポートは存在しません。手元の実行は querystatus だけが埋まった状態で返っており、しかも実在する投稿ではなくプレースホルダーの URL を対象にしていました。つまりスキーマについては語れても、Reddit については、どちらの方向にもまったく語れないということです。だからこのページには例示値も日付形式も充足率もありません。それでも変わらない構造的な事実が 2 つあり、これは列一覧そのものの性質です。エクスポートはフラットです。返信ツリーを組み立てるための親 ID もコメント ID も深さもないので、階層ではなく一覧を前提に設計してください。そしてstatus は最初からパイプラインに組み込む価値があります。プラットフォームのフォーム自体が、アンチボット対策のあるサイトは無料プール(レジデンシャル専用)で blocked ステータスを返すと警告しています。これは共有パイプラインについての一般的な注意であり、何を対象にする場合でも見込んでおく価値があります。作り込む前に、無料枠で 1 件の投稿を実行して最初の数行を見てください。

実行の設定

表計算ではなく、
ジョブ側で設定

投稿 URL のリスト、並び順、上限だけです。並び順と上限は組みで効きます。スレッドのどの部分を手元に残すか、そして 1 回の実行にいくらかかるかを決めます。

Reddit の投稿 URL 1 行に 1 件 並び順: Best 並び順: Top 並び順: New 並び順: Controversial 並び順: Old 並び順: Q&A クエリごとの上限 空欄ですべて CSV · XLSX · TXT · Parquet アップロード 共有プロキシプール、自分の IP は使わない
よくある使い方

ここで最も多く
実行される 3 つの仕事。

コメントデータを使って、実際に抱えている疑問に答えている例をいくつか挙げます。

リサーチ

スレッドが実際に何と言っていたかを読む

投稿のスコアは反応が大きかったことは教えてくれますが、その反応が何だったかは教えてくれません。本文を取得すれば、数字が代役を務めるのではなく、議論そのものが目の前にあります。しかも各行にパーマリンクが付いているので、引用したものはすべて確認できます。

リサーチ · インサイト
プロダクト

賛成票の下にある不満を見つける

Top ではなく Controversial で並べ替えて行数を絞ると、スレッドの中で意見が割れた部分が手に入ります。満たされていないニーズはたいていそこにあります。皆がすでに同意していた意見ではなく、まだ議論が続いている反論のほうです。

製品 · サポート
パイプライン

検索の後ろにつなげる

Reddit 検索スクレイパーで投稿を見つけ、その url 列を残して、そのリストをそのままここのクエリとして流し込みます。検索はどのスレッドが重要かを、こちらはそこで何が語られたかを教えます。2 つのスキーマは意図的に分かれていて、投稿リンクで結合します。

データ · オペレーション
料金

実際に取得した行の
分だけお支払い。

サブスクリプションも、最低利用額も、毎月の請求もありません。最初の500行は当社負担 - その後は従量課金で、ここにある他のスクレイパーと同じ均一料金です。

無料枠

500 行無料 - 0 ドル

新規アカウントごとに初回のみ。クレジットカード不要。クエリごとの上限、ファイルアップロード、すべてのエクスポート形式を含みます。

ずっと 0 ドル
従量課金

無料枠の後は1行 $0.002

コメント 1,000 件あたり約 2 ドル。実行前の見積もりが、開始前に行数とクレジット費用を表示します。想定外の請求も、換算が必要な計算単位もありません。

最も選ばれています
大量利用

カスタム · 大量利用

継続的な監視や非常に大規模なスレッド取得のための、ボリューム価格、専用ワーカー、SLA。数量をお知らせいただければお見積もりします。

ご相談ください
初回の有料実行が 10% オフ。お支払い時にコード LIVESCRAPER10 をご利用ください。
登録する
組み合わせて使う

その出どころの投稿と、
他所での同じ仕事

法的な話

Reddit のコメント
スクレイピングするのは合法ですか。

短い答え。コメントは公開されています。ただしこのエクスポートには個人データが含まれており、その点ははっきり申し上げます。

ここで収集するコメントは、投稿がログインの有無にかかわらず、開いた人すべてに表示しているものです。ログイン、非公開サブレディット、ダイレクトメッセージ、ご自身のものでないアカウントには一切触れません。公開された議論を収集することは長く確立された実務であり、各行のパーマリンクがあるので、取得したものはすべて出どころまでたどれます。

製品カタログとは違い、このエクスポートは個人データです。ほのめかすより、はっきり申し上げます。author は Reddit のアカウントであり、body は人が書いた文章です。匿名ではなく仮名です。ユーザー名は個人と結び付けられることが日常的にあり、コメント本文は書いた人について多くを明かしえます。両方の列は、ご自身に適用されるプライバシー規則のもとで扱い、必要なものだけを保持し、コメントを著者名と並べて再公開する前によく考えてください。

Reddit 自身の利用規約は自動化されたアクセスを制限しており、コンテンツのライセンス条件も一度ならず変更されています。つまりこれは法律の問題であると同時に規約の問題でもあります。とりわけ商用や再配布を伴う用途については、規約をご確認ください。当社はデータ層でサードパーティのトラッカーを一切動かしておらず、エクスポートは 30 日後に自動削除されます。

livescraper.app · 方針
公開コメントのみ
ログインなし、非公開サブレディットなし
ユーザー名は個人データ
どの行もパーマリンクを保持
エクスポートは自動削除(30日)
規模を広げる前に Reddit 自身の規約をご確認ください。
よくある質問

登録前によく
寄せられる質問。

最もよくいただく質問です。ほかにご不明な点は お問い合わせください - 回答を書いているのはボットではなく人間です。

Reddit のコメントはどうやってスクレイピングしますか。+
Reddit コメントスクレイパーを使います。
  1. プラットフォームにサインインします。
  2. Reddit コメントスクレイパーを開きます。
  3. Reddit の投稿 URL を 1 行に 1 件ずつ貼り付けます。CSV・XLSX・TXT・Parquet ファイルをアップロードしてもかまいません。
  4. 並び順を選びます。Best、Top、New、Controversial、Old、Q&A のいずれかです。
  5. クエリごとの上限を設定します。すべて取得する場合は空欄のままにします。
  6. 出力形式を選び、Get Data をクリックします。
Reddit 検索スクレイパーとの違いは何ですか。+
検索は投稿を見つけ、こちらは投稿のコメントを読みます。検索サービスには comments という列がありますが、それは投稿が持つコメントの件数であり、数字であって書かれた内容ではありません。このサービスはコメント本文そのものを返します。先に検索を実行し、その投稿リンクをここに流し込むのが想定された組み合わせです。
返信の構造は得られますか。+
いいえ。スキーマはフラットで、親 ID もコメント ID も深さもない 7 列です。得られるのは返信ツリーではなくコメントの一覧です。送信した投稿 URL が入る query の列だけが行をスレッドに結び付けるものなので、出力に残しておく価値があります。
どのコメントを取得するか選べますか。+
はい、並び順で選べます。行数も絞る場合は、見た目以上に効いてきます。Best、Top、New、Controversial、Old、Q&A の 6 通りです。上限と Top はスレッドが賛同したものを、同じ上限と Controversial は議論になったものを残します。
コメントごとに何が返りますか。+
7 列です。送信した投稿 URL、投稿者、コメント本文、スコア、作成日時、そのコメント自体へのパーマリンク、そしてステータス列。
status 列は何のためにありますか?+
その行の取得がどう進んだかを記録する列で、無視せず読む価値があります。行が中身なしで返ってきたときは、そこに理由が入ります。プラットフォームのフォーム自体も、アンチボット対策のあるサイトは無料プール(レジデンシャル専用)で blocked ステータスを返すと警告しています。これは共有パイプラインについての一般的な注意であり、見込んでおく価値があります。
このページに例示値がないのはなぜですか。+
実物を見ていないからで、でっち上げるより、そう申し上げるほうを選びます。中身の入った Reddit Comments のエクスポートはここにはありません。手元の実行は query と status の列だけが埋まった状態で返っており、しかも実在する投稿ではなくプレースホルダーの URL を対象にしていました。つまりスキーマは確かめられても、Reddit については、どちらの方向にも何も言えません。列名とその順序は確かですが、形式をお約束する立場にはありません。無料枠で 1 件の投稿を実行してご確認ください。
スレッド全体を取得するには。+
上限の欄を空にしてください。初期値は 100 で、最小値は 1 です。ゼロを入力するのではなく空にすることが、投稿が返すすべてを取得する方法です。活発なスレッドは大きくなりうる点にご留意ください。実行が始まる前に、見積もりが行数を表示します。
費用はいくらですか。+
最初の 500 行は無料で、1 回限り、クレジットカードも不要です。それ以降は 1 行 0.002 ドル、コメント 1,000 件あたり約 2 ドルで、当プラットフォームのほかのスクレイパーと同じ均一料金です。見積もりが実行前に費用を表示します。

最初の500行は、
当社のおごり

新規アカウントごとに初回のみ500行無料 - 有効期限はありません。その後は1行 $0.002 の従量課金で、お客様が決めるまでカード情報の登録は不要です。

即時有効 · カード不要

任意の Reddit 投稿からコメントを大規模にスクレイピングする

Livescraper の Reddit コメントスクレイパーは、投稿 URL をコメントの表に変えます。リンクを 1 行に 1 件ずつ貼り付けるか、CSV・XLSX・TXT・Parquet ファイルとしてアップロードし、6 通りの並び順から 1 つを選び、クエリごとの行数に上限を設けるか、すべて取得する場合は欄を空のままにして、結果を整った CSV・Excel・JSON ファイルとしてダウンロードします。リクエストはご自身のアドレスではなく共有プロキシプールから出ていきます。

各行は 1 件のコメントです。送信した投稿 URL、書いたアカウント、コメント本文、スコア、作成日時、そのコメント自体へのパーマリンク、そして取得がどう進んだかを記録するステータス列。考える価値のある設定は並び順です。行数を絞った実行がスレッドのどの部分を残すかを決めるからで、Top と Controversial は同じ投稿について本当に別の問いに答えます。

作り込む前に知っておきたいことが 2 つあります。スキーマはフラットです。親 ID もコメント ID も深さの列もないので、エクスポートは返信ツリーではなくコメントの一覧であり、query の列がスレッドへ戻る唯一の手がかりです。そしてこのページは 7 つの列とその順序を示すだけで、値の形式も充足率も一切お約束しません。その根拠となる、中身の入った Reddit Comments のエクスポートが存在しないからです。手元の実行は query と status の列しか返さず、しかもプレースホルダーの URL を対象にしていたため、スキーマは確かめられても Reddit については、どちらの方向にも何も言えません。

ステータス列を最初からパイプラインに組み込んでおくことにも意味があります。プラットフォームのフォーム自体が、アンチボット対策のあるサイトは無料プール(レジデンシャル専用)で blocked ステータスを返すと警告しています。パーサーを書く前に、無料枠で 1 件の投稿を実行し、最初の数行を読んでください。最初の 500 行は無料でクレジットカードも不要、それ以降は 1 行 0.002 ドルの均一料金です。