必須の入力欄が 1 つと、設定が 2 つ。Reddit のどの断面にお金を使うかを決めるのが並べ替えです。
reddit.com/search/?q=… の URL を貼り付けるか、CSV、XLSX、TXT、Parquet ファイルをアップロードします。上限は実行ごとではなくクエリごとに効きます。検索語 5 つに上限 100 なら、合計 100 件ではなくそれぞれから 100 件です。
ブラウザで読む検索は、Reddit が見せると決めたものです。並べ替えたエクスポートは、あなたが選んだ標本です。
Comment count は議論を見つける並べ替えです。スコアはほどほどでもコメントが数百ある投稿は、人々の意見が割れたスレッドです - 製品や意思決定についての使える細部は、たいていそこにあります。そして Top はそれを表に出しません。
subreddit が title と別になっていることが、サイト全体の検索を有用にします。1 回のクエリで、書かれた場所を問わず投稿が返り、サブレディットごとに検索を分けるのではなく、後からコミュニティ単位でまとめられます。
素の検索語と reddit.com/search/?q=… の URL は、どちらも同じ欄で機能します。ブラウザですでに検索を組み立てているなら - URL に付け足したフィルターごと - 作り直さずに貼り付けられます。
comments とは何か、このページの列名の一つは決まって誤読されます。見当違いのものを前提に計画しないために、30 秒使う価値があります。
comments 列は数字です。投稿にコメントが何件あるか、です。 コメントそのものではありません。このエクスポートのどこにもコメント本文はなく、出す方法もありません - 9 列がスキーマのすべてです。人が実際に書いた内容が必要なら、それはこのプラットフォーム上の別サービスで、独自のスキーマを持っています。どう並べ替えても、こちらでは得られません。
誤解しやすいのは、並べ替えの設定が同じ語を使っているからです。Comment count を選ぶと値 comments が送信されます。並べ替えと列は関係しています - 一方がもう一方で順序づけます - が、どちらもコメント本文ではありません。このサービスはスレッドの索引、コメントのサービスはその中身、と考えてください。
とはいえ、読む価値のあるスレッドを見つけるには、この件数こそが必要なものです。Comment count で並べ替えると、多くの人が返信した投稿が表に出ます。これは Top とは別の、そしてしばしばより良い手がかりです。スコアが高いとは、その投稿に賛同したということ。コメントが多いとは、言いたいことがあったということです。製品調査、不満、比較においては、たいてい後者のほうが役に立ちます。
一つの限界は、末尾に埋めるのではなくここに置きます。 このサービスのエクスポートを 3 つ手元に持っていますが、そのどれにも投稿は入っていません - 内容の列は 4 行すべてで空でした。これをはっきり述べる価値があるのは、実行が失敗したわけではないからです。フォームが求める 2 つの形の両方で、本物のクエリが送信され、それでも query と status だけが埋まった状態で返ってきました。ですから下の列名は頼りにできますが、その先は何も頼りにできません。無料枠で検索を 1 回実行し、ヘッダー行を読んでから、その上に何かを組み立ててください。
これらの名前は二重に確認されています。サービス自身が宣言している列一覧であり、かつ手元にあるすべてのエクスポートのヘッダー行でもあります。各列が何のためにあるかは下記のとおりです。何が入るかは書いていません - 理由は注記のとおりです。
名前は確かです。その先はあなたの最初の実行が確かめることです。 このサービスのエクスポートを 3 つ手元に持っていますが、そのどれにも投稿は入っていません。内容の列 - title、subreddit、author、score、comments、created、url - は 4 行すべてで空でした。何かが入っていたのは query と status だけです。ここで何が重要かは正確に述べる価値があります。クエリは本物でした。 素の検索語と reddit.com/search/?q=… の URL の両方、つまりフォームが求めるとおりの 2 つの形が送信され、それでも行は投稿なしで返ってきました。つまりこれらの実行はエクスポートの形を裏づけるだけで、中身については何も教えません。裏づけられるのは列の一覧です。ヘッダー行は 3 つのエクスポートすべてで同一であり、サービスの宣言している集合と正確に一致します。それ以外のすべて - スコアがどう見えるか、日付がどんな形式で来るか、comments が数値なのか文字列なのか - は、推測するのではなく意図的に書いていません。フォームはさらに、ボット対策のあるサイトは無料プールではブロック状態を返し、それはレジデンシャル専用だとも注意しています。これは共有パイプラインについてのプラットフォーム自身の注意書きであり、織り込んでおく価値があります。無料枠で検索を 1 回実行し、ヘッダー行と最初のいくつかの値を読んでから、その上に何かを組み立ててください。
どれも、Reddit 自身の検索窓に打ち込むようなものから始まります。
製品、企業、あるいは問題をサイト全体で検索し、subreddit を残します。返ってくるのは、どのコミュニティが関心を持っているかの地図です - たいていどの単一スレッドより有用で、ブラウザ検索ではスクロールして自分で組み立てるしかないものです。
同じ語を毎週実行すれば、比較できるファイルが 2 つ手に入ります。新しい投稿、score の動き、増えていく comments の件数が、スクロールに費やす午後ではなく差分になります。そして query が各行を、その元になった検索に結びつけ続けます。
Comment count で並べ替えてファイルの先頭を取れば、意見が一致したスレッドではなく、議論があったスレッドが手に入ります。それが自分で読むべき短いリストであり、何が言われたかを知りたいなら、コメントのサービスへの入力リストにもなります。
サブスクリプションも、最低利用額も、ユーザー単位のライセンスもありません。最初の 500 行は無料で、その後は従量課金です。
新規アカウントごとに 1 回だけ。クレジットカードは不要。すべてのスクレイパーが使えます。手元のどの実行も投稿を返していない以上、ここでいちばん大事なのはこの部分です。計画を立てる前に、数行を使ってこのエクスポートに実際に何が入るのかを確かめてください。
投稿 1,000 件あたりおよそ 2 ドル、プラットフォーム上の他のスクレイパーと同じ一律料金です。上限はクエリごとに効くので、検索語 10 個に上限 100 なら 1,000 行になります。始める前に計算しておく価値があります。
たまに検索を回すのではなく、コミュニティをまたいで一つのテーマを追跡するチーム向けに、ボリューム価格、SLA、専用ワーカー、個別のオンボーディングをご用意します。ご希望の規模をお知らせいただければお見積もりします。
LIVESCRAPER10 をご利用ください。Reddit は人が語る場所の一つです。これらは他の場所を読みます。それぞれ独自のスキーマを持っています。
同じ語を通す価値があるもう一つの検索です。2 つを合わせると、オープンなウェブが言っていることと、コミュニティが言っていることが得られます。両者が一致することはめったにありません。
投稿ではなくアカウント、そしてまた別のスキーマです。Reddit のスレッドが誰かを指していて、その名前の背後にあるプロフィールが欲しいときに役立ちます。
同じ議論が、たいてい別の人たちの間で起きている場所です。どのスレッドがあるかではなく、何が言われたかを求めているなら、必要なのはこの種の道具です。
端的に言えば、これらは公開された検索ページ上の公開された投稿です - ただしユーザー名は人であり、Reddit の規約が自動アクセスを定めています。
これらの列にあるものはすべて、公開された検索結果ページで、ログインの有無にかかわらずどの訪問者にも表示されています。ログインは使わず、ペイウォールも越えず、アカウントにも触れません。実行はご自身のアドレスではなく当社のプロキシプールを経由します。公開されている情報を調査のために収集することは、長く定着した慣行です。
author 列は個人データであり、Reddit ではそれが普段以上に重く効きます。 ユーザー名は匿名ではなく仮名です。多くは何年もの投稿履歴が紐づいた長期的なアイデンティティであり、人々は本名を使っていないからこそ、その名前で物を言います。この列を保存するなら個人データを取り扱っていることになり、入手元がどこであれ GDPR や同様の規制があなたに適用されます。ある話題が何回出てくるかを数えるのは分かりやすい事例です。名前のあるユーザーが何を投稿してきたかのプロフィールを組み立てるのはそうではありませんし、このサービスはそのためのものではありません。
Reddit の規約は自動アクセスを制限しており、その内容は書いた人たちから Reddit にライセンスされています。したがってこれは、公開されていて到達できるかどうかではなく規約の問題であり続けます。規模を広げる前にお読みください。データ層でサードパーティのトラッカーは動かしておらず、エクスポートは 30 日で自動的に削除されます。
最もよくいただく質問です。ほかにもあれば お問い合わせください。回答を書いているのは人であって、ボットではありません。
Reddit 検索スクレイパーは、検索をスプレッドシートに変えます。検索語または reddit.com/search/?q=… の URL を - 1 行に 1 件、自由に混ぜて、あるいは CSV、XLSX、TXT、Parquet ファイルとしてアップロードして - 送信し、上限を設定して並べ替えを選ぶと、各投稿が 1 行として返ります。タイトル、投稿されたサブレディット、投稿者、スコア、コメント件数、投稿日時、そしてリンク。9 列、投稿 1 件につき 1 行で、CSV、Excel、JSON としてダウンロードできます。サービス自身の説明が端的に述べています。検索結果を返す、と。
いちばん誤読されやすい列は comments で、これはコメントそのものではなく件数です。 この 9 列のどれもコメント本文ではなく、どの並べ替えでも出てきません - 書かれた内容の取得は、独自のスキーマを持つ別サービスです。この語はインターフェース上で二重の役目を負っています。Comment count の並べ替えを選ぶと値 comments が送信されるからです。ただし並べ替えも列も「何件か」であって「何を」ではありません。覚え方としては、このサービスはスレッドの索引であり、もう一方はその中身です。
その件数で並べ替える価値はあります。順序は 5 つ用意されています - Relevance、Hot、Top、New、Comment count - そして最後のものが、他ではめったに見かけないものです。スコアの高い投稿は、人々が賛同した投稿。コメントの多い投稿は、議論になった投稿であり、製品調査、不満、比較では、細部はたいてい議論の側にあります。subreddit が独立した列で届くことは、サイト全体の検索を実行する価値を生むもう一つの点です。1 回のクエリで、書かれた場所を問わず投稿が返り、サブレディットごとに個別に検索するのではなく、後からコミュニティ単位でまとめられます。上限はクエリごとに効くので、語が複数あれば掛け算になります。
一つの限界をはっきり述べておきます。このページに何を期待すべきかが変わるからです。エクスポートを 3 つ手元に持っていますが、そのどれにも投稿は入っていません。内容の列は 4 行すべてで空でした。これは正確に述べる価値があります。実行が失敗したわけではないからです - フォームが受け付ける 2 つの形で本物のクエリが送信され、それでも行は query と status だけが埋まった状態で返ってきました。ですから上の 9 つの名前は頼りにできますし、その先のすべては、でっち上げるのではなく意図的に書いていません。フォームはさらに、ボット対策のあるサイトは無料プールではブロック状態を返し、それはレジデンシャル専用だとも注意しています。これは共有パイプラインについてのプラットフォーム自身の注意書きであり、織り込んでおく価値があります。法的な面では、収集されるものはすべて公開されていますが、author は実在の人物の投稿履歴が紐づいた仮名のユーザー名です - 個人データとして扱い、規模を広げる前に Reddit の規約をお読みください。無料で始められます。最初の 500 行は無料でカードも不要、それ以降は 1 行あたり 0.002 ドルの一律料金です。現在の料金は料金ページをご覧ください。