Reddit 検索スクレイパー

Reddit を検索して、
結果を手元に残す

検索語を入力するか、reddit.com/search/?q=… の URL を貼り付けると、投稿が表になって返ります。タイトル、どのサブレディットにあったか、誰が投稿したか、スコア、コメント数、投稿日時、そしてリンク。9 列、投稿 1 件につき 1 行、並べ替えはお好みで。

500 行無料、初回のみ以降は 1 行 0.002 ドル投稿 1 件につき 1 行CSV · JSON · Excel
使い方

検索を 1 つ、
それと並べ替え

必須の入力欄が 1 つと、設定が 2 つ。Reddit のどの断面にお金を使うかを決めるのが並べ替えです。

  1. ステップ 1プラットフォームにログインします。
  2. ステップ 2Reddit 検索スクレイパーを開きます。
  3. ステップ 3検索語を 1 行に 1 件ずつ入力します - または reddit.com/search/?q=… の URL を貼り付けるか、CSV、XLSX、TXT、Parquet ファイルをアップロードします。
  4. ステップ 4必要であればクエリごとの上限を設定します。この欄は最小 1 を受け付け、既定は 100 です。
  5. ステップ 5並べ替えを選びます: RelevanceHotTopNewComment count
  6. ステップ 6Get Data をクリックし、CSV、JSON、Excel でダウンロードします。

上限は実行ごとではなくクエリごとに効きます。検索語 5 つに上限 100 なら、合計 100 件ではなくそれぞれから 100 件です。

役に立つ理由

5 種類の並べ替え、
うち 1 つは他では手に入りにくいもの

ブラウザで読む検索は、Reddit が見せると決めたものです。並べ替えたエクスポートは、あなたが選んだ標本です。

スコアだけでなくコメント数で並べ替える

Comment count は議論を見つける並べ替えです。スコアはほどほどでもコメントが数百ある投稿は、人々の意見が割れたスレッドです - 製品や意思決定についての使える細部は、たいていそこにあります。そして Top はそれを表に出しません。

サブレディットが独立した列で返る

subreddittitle と別になっていることが、サイト全体の検索を有用にします。1 回のクエリで、書かれた場所を問わず投稿が返り、サブレディットごとに検索を分けるのではなく、後からコミュニティ単位でまとめられます。

同じことを尋ねる 2 つの方法

素の検索語と reddit.com/search/?q=… の URL は、どちらも同じ欄で機能します。ブラウザですでに検索を組み立てているなら - URL に付け足したフィルターごと - 作り直さずに貼り付けられます。

まずこれを

comments とは何か、
そして何ではないか

このページの列名の一つは決まって誤読されます。見当違いのものを前提に計画しないために、30 秒使う価値があります。

comments 列は数字です。投稿にコメントが何件あるか、です。 コメントそのものではありません。このエクスポートのどこにもコメント本文はなく、出す方法もありません - 9 列がスキーマのすべてです。人が実際に書いた内容が必要なら、それはこのプラットフォーム上の別サービスで、独自のスキーマを持っています。どう並べ替えても、こちらでは得られません。

誤解しやすいのは、並べ替えの設定が同じ語を使っているからです。Comment count を選ぶと値 comments が送信されます。並べ替えと列は関係しています - 一方がもう一方で順序づけます - が、どちらもコメント本文ではありません。このサービスはスレッドの索引、コメントのサービスはその中身、と考えてください。

とはいえ、読む価値のあるスレッドを見つけるには、この件数こそが必要なものです。Comment count で並べ替えると、多くの人が返信した投稿が表に出ます。これは Top とは別の、そしてしばしばより良い手がかりです。スコアが高いとは、その投稿に賛同したということ。コメントが多いとは、言いたいことがあったということです。製品調査、不満、比較においては、たいてい後者のほうが役に立ちます。

一つの限界は、末尾に埋めるのではなくここに置きます。 このサービスのエクスポートを 3 つ手元に持っていますが、そのどれにも投稿は入っていません - 内容の列は 4 行すべてで空でした。これをはっきり述べる価値があるのは、実行が失敗したわけではないからです。フォームが求める 2 つの形の両方で、本物のクエリが送信され、それでも querystatus だけが埋まった状態で返ってきました。ですから下の列名は頼りにできますが、その先は何も頼りにできません。無料枠で検索を 1 回実行し、ヘッダー行を読んでから、その上に何かを組み立ててください。

得られるもの

9 列、
そして裏づけのある名前

これらの名前は二重に確認されています。サービス自身が宣言している列一覧であり、かつ手元にあるすべてのエクスポートのヘッダー行でもあります。各列が何のためにあるかは下記のとおりです。何が入るかは書いていません - 理由は注記のとおりです。

query
この行の元になった検索語または検索 URL が返ります。スクレイパーが書き込むため、リクエストが失敗した場合でも行に入っています。1 つのファイルが複数の検索にまたがるときは、これでグループ化してください。
title
投稿のタイトル。投稿した人が書いたとおりです。
subreddit
その投稿があるコミュニティ。独立した列なので、サイト全体の検索を投稿の出どころ別にまとめられます。
author
その投稿の author として表示される Reddit のユーザー名。下の法務の注記をご覧ください - ユーザー名は匿名ではなく仮名です。
score
投稿のスコア。Reddit のスコアは賛成票から反対票を引いたもので、賛成票の総数ではありません。多くの人が見た投稿でも低くなり得ます。ここでは尺度も形式も示していません。値を見たことがないからです。
comments
その投稿のコメント件数 - 件数であって、コメントではありません。 このエクスポートにコメント本文はありません。上の注記をお読みください。本文は独自のスキーマを持つ別サービスが返します。
created
投稿された日時。エクスポートが報告するとおりです。値を見たことがないため、このページは形式について何も主張しません。ご自身の実行で確認するまで、タイムスタンプとして解析できると決めてかからないでください。
url
投稿へのリンク。
status
このリクエストがどうなったか - これを最初に読んでください。 失敗したリクエストも消えるのではなく、そうと分かる行として返るため、どのクエリが通らなかったかが正確に分かります。9 項目すべてが揃った行であっても、投稿ではなく失敗の通知であることがあります。

名前は確かです。その先はあなたの最初の実行が確かめることです。 このサービスのエクスポートを 3 つ手元に持っていますが、そのどれにも投稿は入っていません。内容の列 - title、subreddit、author、score、comments、created、url - は 4 行すべてで空でした。何かが入っていたのは querystatus だけです。ここで何が重要かは正確に述べる価値があります。クエリは本物でした。 素の検索語と reddit.com/search/?q=… の URL の両方、つまりフォームが求めるとおりの 2 つの形が送信され、それでも行は投稿なしで返ってきました。つまりこれらの実行はエクスポートの形を裏づけるだけで、中身については何も教えません。裏づけられるのは列の一覧です。ヘッダー行は 3 つのエクスポートすべてで同一であり、サービスの宣言している集合と正確に一致します。それ以外のすべて - スコアがどう見えるか、日付がどんな形式で来るか、comments が数値なのか文字列なのか - は、推測するのではなく意図的に書いていません。フォームはさらに、ボット対策のあるサイトは無料プールではブロック状態を返し、それはレジデンシャル専用だとも注意しています。これは共有パイプラインについてのプラットフォーム自身の注意書きであり、織り込んでおく価値があります。無料枠で検索を 1 回実行し、ヘッダー行と最初のいくつかの値を読んでから、その上に何かを組み立ててください。

ユースケース

実際に使われている
3 つの場面。

どれも、Reddit 自身の検索窓に打ち込むようなものから始まります。

リサーチ

その話題が実際にどこで語られているかを見つける

製品、企業、あるいは問題をサイト全体で検索し、subreddit を残します。返ってくるのは、どのコミュニティが関心を持っているかの地図です - たいていどの単一スレッドより有用で、ブラウザ検索ではスクロールして自分で組み立てるしかないものです。

リサーチ · 戦略
定点観測

同じ検索を定期的に再実行する

同じ語を毎週実行すれば、比較できるファイルが 2 つ手に入ります。新しい投稿、score の動き、増えていく comments の件数が、スクロールに費やす午後ではなく差分になります。そして query が各行を、その元になった検索に結びつけ続けます。

ブランド · ソーシャルリスニング
選別

読む価値のあるスレッドを絞り込む

Comment count で並べ替えてファイルの先頭を取れば、意見が一致したスレッドではなく、議論があったスレッドが手に入ります。それが自分で読むべき短いリストであり、何が言われたかを知りたいなら、コメントのサービスへの入力リストにもなります。

製品 · サポート
料金

投稿の行数分だけ、
ほかは何も

サブスクリプションも、最低利用額も、ユーザー単位のライセンスもありません。最初の 500 行は無料で、その後は従量課金です。

無料

500 行

新規アカウントごとに 1 回だけ。クレジットカードは不要。すべてのスクレイパーが使えます。手元のどの実行も投稿を返していない以上、ここでいちばん大事なのはこの部分です。計画を立てる前に、数行を使ってこのエクスポートに実際に何が入るのかを確かめてください。

1 回限り · カード不要
従量課金

1 行あたり 0.002 ドル

投稿 1,000 件あたりおよそ 2 ドル、プラットフォーム上の他のスクレイパーと同じ一律料金です。上限はクエリごとに効くので、検索語 10 個に上限 100 なら 1,000 行になります。始める前に計算しておく価値があります。

クレジットに有効期限なし
エンタープライズ

カスタム - テーマ全体を、定期実行で

たまに検索を回すのではなく、コミュニティをまたいで一つのテーマを追跡するチーム向けに、ボリューム価格、SLA、専用ワーカー、個別のオンボーディングをご用意します。ご希望の規模をお知らせいただければお見積もりします。

営業に相談
初回の有料実行が 10% オフ。決済時にコード LIVESCRAPER10 をご利用ください。
登録する
組み合わせて使う

同じ問いを、
別の場所で

Reddit は人が語る場所の一つです。これらは他の場所を読みます。それぞれ独自のスキーマを持っています。

法務

Reddit の検索結果
スクレイピングするのは合法ですか?

端的に言えば、これらは公開された検索ページ上の公開された投稿です - ただしユーザー名は人であり、Reddit の規約が自動アクセスを定めています。

これらの列にあるものはすべて、公開された検索結果ページで、ログインの有無にかかわらずどの訪問者にも表示されています。ログインは使わず、ペイウォールも越えず、アカウントにも触れません。実行はご自身のアドレスではなく当社のプロキシプールを経由します。公開されている情報を調査のために収集することは、長く定着した慣行です。

author 列は個人データであり、Reddit ではそれが普段以上に重く効きます。 ユーザー名は匿名ではなく仮名です。多くは何年もの投稿履歴が紐づいた長期的なアイデンティティであり、人々は本名を使っていないからこそ、その名前で物を言います。この列を保存するなら個人データを取り扱っていることになり、入手元がどこであれ GDPR や同様の規制があなたに適用されます。ある話題が何回出てくるかを数えるのは分かりやすい事例です。名前のあるユーザーが何を投稿してきたかのプロフィールを組み立てるのはそうではありませんし、このサービスはそのためのものではありません。

Reddit の規約は自動アクセスを制限しており、その内容は書いた人たちから Reddit にライセンスされています。したがってこれは、公開されていて到達できるかどうかではなく規約の問題であり続けます。規模を広げる前にお読みください。データ層でサードパーティのトラッカーは動かしておらず、エクスポートは 30 日で自動的に削除されます。

livescraper.app · 方針
公開された検索結果のみ
ログインもペイウォールもなし
ユーザー名は匿名ではなく仮名です - 個人データとして取り扱ってください!
データ層にサードパーティのトラッカーなし
エクスポートは自動削除(30 日)
どの訪問者も Reddit 自身の検索で目にするのと同じ投稿です。
よくある質問

登録前によく聞かれること

最もよくいただく質問です。ほかにもあれば お問い合わせください。回答を書いているのは人であって、ボットではありません。

何を送信しますか?+
素の検索語か、reddit.com/search/?q=… の形の Reddit 検索 URL のいずれかを、1 行に 1 件、自由に混ぜて入力します。フォーム自身のプレースホルダーが両方の形を示しています。貼り付ける代わりに CSV、XLSX、TXT、Parquet ファイルをアップロードすることもできます。
エクスポートにはどの列が含まれますか?+
9 列です。query、title、subreddit、author、score、comments、created、url、status。これはサービス自身が宣言している列一覧で、手元にあるすべてのエクスポートのヘッダー行と一致します。
これは投稿へのコメントを返しますか?+
いいえ。comments 列は投稿にコメントが何件あるかの件数であり、コメントそのものではありません。この 9 列のどこにもコメント本文はありません。人が実際に書いた内容を取得するのは、プラットフォーム上の別サービスで、独自のスキーマを持っています。スレッドを見つけるにはこちらを、読むにはあちらをお使いください。
並び順の選択肢は何ですか?+
5 つです。Relevance、Hot、Top、New、Comment count。Comment count は他ではめったに得られないもので、多くの場合いちばん役に立ちます - スコアがほどほどでコメントの多い投稿は、意見が割れたスレッドであり、細部はたいていそこにあります。
created 列の形式は何ですか?+
申し上げません。それは意図的です。手元にあるどの実行も投稿を返さなかったため、この列の値を見たことがないからです。日付の列はまさに、人が解析コードを書く相手になる種類の項目なので、推測は役に立たないどころか有害です。無料枠で検索を 1 回実行して、まずご自身で確かめてください。
実際に実行したことはありますか?+
3 回動かしましたが、投稿を返した実行は 1 つもありません - 内容の列は 4 行すべてで空でした。何が重要かは正確に述べる価値があります。クエリはプレースホルダーではなく本物でした。フォームが求める 2 つの形、素の検索語と reddit.com/search の URL の両方が送信され、それでも行は query と status だけが埋まった状態で返ってきました。これで分かるのはエクスポートの形だけで、中身については何も分かりません。ページを取り繕うより、そう申し上げるほうを選びます。
プロキシは必要ですか?+
フォームは、ボット対策のあるサイトは無料プールではブロック状態を返し、それはレジデンシャル専用だと注意しています。これはこのサイトについての言明ではなく、共有パイプラインについてのプラットフォーム自身の注意書きであり、織り込んでおく価値があります。当社の側から言えることはもっと限定的で、もっと役に立ちます。手元にある 3 つのエクスポートは、どれも投稿が入った状態では返ってきませんでした。ですから、残りの列の上に何かを組み立てる前に、ご自身の最初の実行で status 列を読んでください。
料金はいくらですか?+
新規アカウントの最初の 500 行は無料で、これは 1 回限りです。その後は 1 行 0.002 ドル(1,000 行でおよそ 2 ドル)の従量課金で、サブスクリプションはありません。クレジットに有効期限はなく、毎月リセットされることもありません。

まずスレッドを見つける。
読むのはその次

検索を 1 回実行し、コメント数で並べ替えて、どの会話に午後を使う価値があるかをご覧ください。最初の 500 行は無料です。

Reddit の検索結果を行としてエクスポートする

Reddit 検索スクレイパーは、検索をスプレッドシートに変えます。検索語または reddit.com/search/?q=… の URL を - 1 行に 1 件、自由に混ぜて、あるいは CSV、XLSX、TXT、Parquet ファイルとしてアップロードして - 送信し、上限を設定して並べ替えを選ぶと、各投稿が 1 行として返ります。タイトル、投稿されたサブレディット、投稿者、スコア、コメント件数、投稿日時、そしてリンク。9 列、投稿 1 件につき 1 行で、CSV、Excel、JSON としてダウンロードできます。サービス自身の説明が端的に述べています。検索結果を返す、と。

いちばん誤読されやすい列は comments で、これはコメントそのものではなく件数です。 この 9 列のどれもコメント本文ではなく、どの並べ替えでも出てきません - 書かれた内容の取得は、独自のスキーマを持つ別サービスです。この語はインターフェース上で二重の役目を負っています。Comment count の並べ替えを選ぶと値 comments が送信されるからです。ただし並べ替えも列も「何件か」であって「何を」ではありません。覚え方としては、このサービスはスレッドの索引であり、もう一方はその中身です。

その件数で並べ替える価値はあります。順序は 5 つ用意されています - Relevance、Hot、Top、New、Comment count - そして最後のものが、他ではめったに見かけないものです。スコアの高い投稿は、人々が賛同した投稿。コメントの多い投稿は、議論になった投稿であり、製品調査、不満、比較では、細部はたいてい議論の側にあります。subreddit が独立した列で届くことは、サイト全体の検索を実行する価値を生むもう一つの点です。1 回のクエリで、書かれた場所を問わず投稿が返り、サブレディットごとに個別に検索するのではなく、後からコミュニティ単位でまとめられます。上限はクエリごとに効くので、語が複数あれば掛け算になります。

一つの限界をはっきり述べておきます。このページに何を期待すべきかが変わるからです。エクスポートを 3 つ手元に持っていますが、そのどれにも投稿は入っていません。内容の列は 4 行すべてで空でした。これは正確に述べる価値があります。実行が失敗したわけではないからです - フォームが受け付ける 2 つの形で本物のクエリが送信され、それでも行は querystatus だけが埋まった状態で返ってきました。ですから上の 9 つの名前は頼りにできますし、その先のすべては、でっち上げるのではなく意図的に書いていません。フォームはさらに、ボット対策のあるサイトは無料プールではブロック状態を返し、それはレジデンシャル専用だとも注意しています。これは共有パイプラインについてのプラットフォーム自身の注意書きであり、織り込んでおく価値があります。法的な面では、収集されるものはすべて公開されていますが、author は実在の人物の投稿履歴が紐づいた仮名のユーザー名です - 個人データとして扱い、規模を広げる前に Reddit の規約をお読みください。無料で始められます。最初の 500 行は無料でカードも不要、それ以降は 1 行あたり 0.002 ドルの一律料金です。現在の料金は料金ページをご覧ください。