投稿と並び順はあなたが選びます。ジョブはそれぞれの投稿のコメントを読み、返ってきたコメントごとに 1 行を書き出します。
1 コメント 1 行で、どの行にも取得元の投稿 URL が付きます。この点はここでは特に重要です。コメントをスレッドに結び付ける列がほかにないからです。
コメント本文を返すのがこのサービスです。対になる Reddit 検索スクレイパーには comments という列がありますが、あれは投稿が持つコメントの件数、つまり数字です。数ではなく文章がほしいならこちらで、2 つは続けて実行することを想定して作られています。
Best、Top、New、Controversial、Old、Q&A。クエリごとに行数を絞るなら、並び順は飾りではありません。上限と Top の組み合わせはスレッドが賛同したコメントを、同じ上限と Controversial の組み合わせは論争そのものを返します。上限を決めた後ではなく、上限を念頭に置いて並び順を選んでください。
各コメントは投稿のリンクだけでなく、自分自身のパーマリンクを持っています。だからこそ数か月後でもエクスポートを検証できます。レポート中の引用は、その出どころのコメントまで正確にたどれ、確認する人はスレッドを手作業で探さずに開けます。
各行は 1 件のコメントです。誰が書いたか、何と書いてあるか、どう評価されたか、いつ現れたか、どこにあるか、そして取得がどう進んだか。
このエクスポートを前提に設計する前に知っておきたいことが 2 つあり、どちらも実行結果ではなくスキーマの形から導かれます。1 つ目はフラットであること。親 ID もコメント ID も深さの列もないので、得られるのはコメントの一覧であって返信ツリーではありません。query だけが行をスレッドに結び付けるものであり、だからこそ残しておく価値があります。2 つ目は status が飾りではなく実用の列だということです。下の列一覧はプラットフォームが公開している配列で、アーカイブ済み実行のヘッダーと突き合わせてあります。パーサーを書く前にその下の注記をお読みください。このページが何を伝え、何を伝えないかを率直に書いてあります。
エクスポートのヘッダー行を順序どおりに、プラットフォームが公開する列一覧と照合したものです。説明は各項目が何のためのものかを述べます。書式や、どれくらいの頻度で値が入るかについては何も主張しません - 下の注記をご覧ください。
comments フィールドが書かれた内容ではなく件数であるのに対し、このサービスを分けているのがこの列です。この辞書は名前の一覧として読んでください。中身についての約束ではありません。7 つの名前とその順序は確かです。プラットフォームが公開している列一覧と、アーカイブ済み実行のヘッダー行が正確に一致しています。定まっていないのはそこに何が入るかで、中身の入った Reddit Comments のエクスポートは存在しません。手元の実行は query と status だけが埋まった状態で返っており、しかも実在する投稿ではなくプレースホルダーの URL を対象にしていました。つまりスキーマについては語れても、Reddit については、どちらの方向にもまったく語れないということです。だからこのページには例示値も日付形式も充足率もありません。それでも変わらない構造的な事実が 2 つあり、これは列一覧そのものの性質です。エクスポートはフラットです。返信ツリーを組み立てるための親 ID もコメント ID も深さもないので、階層ではなく一覧を前提に設計してください。そしてstatus は最初からパイプラインに組み込む価値があります。プラットフォームのフォーム自体が、アンチボット対策のあるサイトは無料プール(レジデンシャル専用)で blocked ステータスを返すと警告しています。これは共有パイプラインについての一般的な注意であり、何を対象にする場合でも見込んでおく価値があります。作り込む前に、無料枠で 1 件の投稿を実行して最初の数行を見てください。
投稿 URL のリスト、並び順、上限だけです。並び順と上限は組みで効きます。スレッドのどの部分を手元に残すか、そして 1 回の実行にいくらかかるかを決めます。
コメントデータを使って、実際に抱えている疑問に答えている例をいくつか挙げます。
投稿のスコアは反応が大きかったことは教えてくれますが、その反応が何だったかは教えてくれません。本文を取得すれば、数字が代役を務めるのではなく、議論そのものが目の前にあります。しかも各行にパーマリンクが付いているので、引用したものはすべて確認できます。
Top ではなく Controversial で並べ替えて行数を絞ると、スレッドの中で意見が割れた部分が手に入ります。満たされていないニーズはたいていそこにあります。皆がすでに同意していた意見ではなく、まだ議論が続いている反論のほうです。
Reddit 検索スクレイパーで投稿を見つけ、その url 列を残して、そのリストをそのままここのクエリとして流し込みます。検索はどのスレッドが重要かを、こちらはそこで何が語られたかを教えます。2 つのスキーマは意図的に分かれていて、投稿リンクで結合します。
サブスクリプションも、最低利用額も、毎月の請求もありません。最初の500行は当社負担 - その後は従量課金で、ここにある他のスクレイパーと同じ均一料金です。
新規アカウントごとに初回のみ。クレジットカード不要。クエリごとの上限、ファイルアップロード、すべてのエクスポート形式を含みます。
コメント 1,000 件あたり約 2 ドル。実行前の見積もりが、開始前に行数とクレジット費用を表示します。想定外の請求も、換算が必要な計算単位もありません。
継続的な監視や非常に大規模なスレッド取得のための、ボリューム価格、専用ワーカー、SLA。数量をお知らせいただければお見積もりします。
LIVESCRAPER10 をご利用ください。短い答え。コメントは公開されています。ただしこのエクスポートには個人データが含まれており、その点ははっきり申し上げます。
ここで収集するコメントは、投稿がログインの有無にかかわらず、開いた人すべてに表示しているものです。ログイン、非公開サブレディット、ダイレクトメッセージ、ご自身のものでないアカウントには一切触れません。公開された議論を収集することは長く確立された実務であり、各行のパーマリンクがあるので、取得したものはすべて出どころまでたどれます。
製品カタログとは違い、このエクスポートは個人データです。ほのめかすより、はっきり申し上げます。author は Reddit のアカウントであり、body は人が書いた文章です。匿名ではなく仮名です。ユーザー名は個人と結び付けられることが日常的にあり、コメント本文は書いた人について多くを明かしえます。両方の列は、ご自身に適用されるプライバシー規則のもとで扱い、必要なものだけを保持し、コメントを著者名と並べて再公開する前によく考えてください。
Reddit 自身の利用規約は自動化されたアクセスを制限しており、コンテンツのライセンス条件も一度ならず変更されています。つまりこれは法律の問題であると同時に規約の問題でもあります。とりわけ商用や再配布を伴う用途については、規約をご確認ください。当社はデータ層でサードパーティのトラッカーを一切動かしておらず、エクスポートは 30 日後に自動削除されます。
最もよくいただく質問です。ほかにご不明な点は お問い合わせください - 回答を書いているのはボットではなく人間です。
Livescraper の Reddit コメントスクレイパーは、投稿 URL をコメントの表に変えます。リンクを 1 行に 1 件ずつ貼り付けるか、CSV・XLSX・TXT・Parquet ファイルとしてアップロードし、6 通りの並び順から 1 つを選び、クエリごとの行数に上限を設けるか、すべて取得する場合は欄を空のままにして、結果を整った CSV・Excel・JSON ファイルとしてダウンロードします。リクエストはご自身のアドレスではなく共有プロキシプールから出ていきます。
各行は 1 件のコメントです。送信した投稿 URL、書いたアカウント、コメント本文、スコア、作成日時、そのコメント自体へのパーマリンク、そして取得がどう進んだかを記録するステータス列。考える価値のある設定は並び順です。行数を絞った実行がスレッドのどの部分を残すかを決めるからで、Top と Controversial は同じ投稿について本当に別の問いに答えます。
作り込む前に知っておきたいことが 2 つあります。スキーマはフラットです。親 ID もコメント ID も深さの列もないので、エクスポートは返信ツリーではなくコメントの一覧であり、query の列がスレッドへ戻る唯一の手がかりです。そしてこのページは 7 つの列とその順序を示すだけで、値の形式も充足率も一切お約束しません。その根拠となる、中身の入った Reddit Comments のエクスポートが存在しないからです。手元の実行は query と status の列しか返さず、しかもプレースホルダーの URL を対象にしていたため、スキーマは確かめられても Reddit については、どちらの方向にも何も言えません。
ステータス列を最初からパイプラインに組み込んでおくことにも意味があります。プラットフォームのフォーム自体が、アンチボット対策のあるサイトは無料プール(レジデンシャル専用)で blocked ステータスを返すと警告しています。パーサーを書く前に、無料枠で 1 件の投稿を実行し、最初の数行を読んでください。最初の 500 行は無料でクレジットカードも不要、それ以降は 1 行 0.002 ドルの均一料金です。