ここに並べ替えの設定はありません。実行を形づくるのは、何を打つかと、どれだけ欲しいかです。
bbb.org/us/category/… のようなカテゴリ URL、あるいは希望の地域フィルターを付けた完全な bbb.org/search?… URL を入力します - 1 行に 1 件、自由に混ぜて構いません。先に bbb.org 上で検索を組み立てるのが、場所を確定させる簡単な方法です。そこで設定したフィルターは URL とともに運ばれます。
このエクスポートが持っていて、一般的な企業名簿にはたいてい無いものが 3 つあります。
rating は BBB が付ける文字評価で、A+ のような文字列です。星の点数ではありません。accredited は、その企業が認定に対して費用を払っているかどうかを示します。この 2 つを合わせると、地図の掲載情報からは組み立てられない絞り込みができます。ある業種の中で、評価が付き認定を受けた企業の一覧です。
category が主たる業種、all_categories がカンマで連結された全リストで、たいてい複数あります。屋根工事の会社が窓や外壁も掲げていれば、その両方が見えます - 狭く検索しても、その会社が自称する他のすべてを見られるということです。
電話、ウェブサイト、住所、そして多くの場合メールが独立した列で返り、years_in_business と名前のある担当者も付きます。すべての企業がすべてを公開しているわけではありません - このエクスポートがそれをどう扱うかは下の注記をご覧ください。予想どおりの動きはしません。
このサービスで唯一、本当に意外な点であり、素朴に書いたコードを壊します。ここでの 2 分が午後 1 つ分を節約します。
企業がある項目を公開していない場合、その列は空欄になるのではなく、その行から丸ごと消えます。 読んだ行を通して、1 つのファイルの中に何十通りものキーの組み合わせがありました。すべての行にあった列はごくわずかです。クエリ、プロフィール URL、名称、主たる業種、電話、市、州、郵便番号、そして認定の有無。それ以外は、その企業が何を公開したかによって現れたり消えたりします。
CSV や Excel のダウンロードでは、これは見えません - 列は揃い、欠けた部分は空のセルになります。JSON エクスポートでは大きな違いになります。 row.website を読んで文字列を期待するコードは、空文字ではなく undefined を受け取りますし、行ごとに同じ形を前提にしたものは、メールを公開していない最初の企業で落ちます。防御的に読むか、表計算形式を取って正規化を任せてください。
宣言されている列のうち 2 つは、私たちが実行した限りでは一度も現れませんでした - licenses と social_media です。サービスが宣言する列一覧には含まれているので、私たちが触れていない企業やカテゴリでは値が入るかもしれません。しかしどちらにも値が入っているのを見たことがないため、下の表には項目を設けていません。表が 32 ではなく 30 なのはそのためです。
1 つの列は意図的に崩された形で返ります。 additional_emails は BBB 自身のスクレイピング対策の難読化を帯びており、アドレスは …finance__at__troysellersauto__dot__com… のような形で、目印に挟まれて現れます。この項目を持つ行はすべてそうなっており、素の email 列は決してそうなりません。元に戻すのは機械的な作業ですが、そうすべきだと知っている必要があります。目印を取り除き、__at__ を @ に、__dot__ をドットに変えれば、きれいな列が持つのと同じアドレスになります。
名前はサービス自身が宣言している一覧です。形式は実際の行から読み取りました。企業が公開していない場合、その多くは空ではなく「無い」ことを忘れないでください。
category と同一でした。primary_category と同じ値でした。primary_category とは違い、すべての行に存在します。years_in_business をまたいで計算するなら注意すべき点です。__at__ と __dot__ を使った形が目印に挟まれています。この項目を持つ行はすべてそうです。使う前にデコードするか、email のほうを使ってください。average_rating と同時に現れました - 片方だけということはありません。上の形式は説明したのではなく計測したものです。 6 つのエクスポート、すべての行を読みました。rating は文字評価の文字列、average_rating は 1 から 5 の数値で常に reviews_total と対になり、accredited は Yes か No の文字列、service_area は配列、images は単一のオブジェクト、all_categories はカンマ連結の文字列、そして category は両方を持つすべての行で primary_category と同一でした。持ち帰るべき点が 2 つあります。 第一に、このエクスポートはキーを空にせず省くため、任意の行で存在が保証される列はごくわずかです。JSON は防御的に読むか、表計算を取ってください。第二に、上の表は宣言済み 32 列のうち 30 列です。licenses と social_media は私たちが実行した限りでは現れなかったため、値を一度も見ていない項目を説明するより、ここで名前を挙げて表からは外しています。私たちが触れなかったカテゴリでは値が入るかもしれません。実行したのはすべて米国の検索なので、他地域の網羅性についてもこのページは何も主張しません。
どれも、BBB 自身の検索窓に打ち込むようなものから始まります。
カテゴリを検索し、rating と accredited を残せば、地図の掲載情報では作れない基準 - BBB 自身の評価 - で絞ったリストになります。years_in_business を加えれば、新しいプロフィールより実績のある企業を優先できます。
取引している業種を入れ、name と displayed_address で突き合わせます。返ってくるのは評価、認定の有無、そして各社の営業年数です。評価が気になれば url がそのままプロフィールへ連れて行きます。
service_area は、その企業が出向く郡や州の配列です。これは事務所がどこにあるかとは別の問いです。テリトリーのカバレッジを計画する人にとっては、その区別こそが要点です。
サブスクリプションも、最低利用額も、ユーザー単位のライセンスもありません。最初の 500 行は無料で、その後は従量課金です。
新規アカウントごとに 1 回だけ。クレジットカードは不要。すべてのスクレイパーが使えます - カテゴリを 1 つ実行し、どの列が現れてどの列がそもそも無いのかをご自身の目で確かめるには十分です。
企業 1,000 件あたりおよそ 2 ドル、プラットフォーム上の他のスクレイパーと同じ一律料金です。上限はクエリごとに効き、既定値がないため、広いカテゴリを空欄のままにすると長く走り得ます - まず小さく設定してください。
候補リストではなく名簿そのものを構築するチーム向けに、ボリューム価格、SLA、専用ワーカー、個別のオンボーディングをご用意します。ご希望の規模をお知らせいただければお見積もりします。
LIVESCRAPER10 をご利用ください。こちらは企業を返します。あちらは、その企業について語られたことと、他にどこに載っているかを返します。
次の一手として当然の選択です。このページの url 列が、そのまま向こうの入力になります。ただし向こうの rating は 1 から 5 の顧客の星評価であって、ここで得られる文字評価ではない点にご注意ください。
同じ企業を、広く一般の目に映る形で。網羅範囲ははるかに広く、列の構成も独自です。BBB に一度も登録していない企業を見つけるのに役立ちます。
ここでウェブサイトは公開しているがアドレスは載せていないプロフィール向けです。website 列に向ければ、名簿の記載ではなくサイトそのものを読みます。
端的に言えば、これらは公開された企業の掲載情報です - ただしこのエクスポートは、たいていのものより人に関する情報を多く含んでおり、そこは意識して扱う価値があります。
これらの列にあるものはすべて、公開された BBB のプロフィールで、ログインの有無にかかわらずどの訪問者にも表示されています。ログインは使わず、ペイウォールも越えず、アカウントにも触れません。実行はご自身のアドレスではなく当社のプロキシプールを経由します。公開されている企業情報を調査、リード獲得、デューデリジェンスのために収集することは、長く定着した慣行です。
ビジネス上の連絡先データが、自動的にプライバシー法の対象外になるわけではありません。 contact_information には名前のある個人とその役職が入りますし、email、phone、additional_phone は、企業名の下にあってもなお人に到達する手段です。小規模事業者の掲載住所は、しばしば誰かの自宅です。GDPR や同様の規制の下ではこれは個人データであり、営業目的で使うつもりなら、さらに満たすべきマーケティング規則があります - 米国の CAN-SPAM、英国と EU の PECR および GDPR です。これらは、アドレスをどう入手したかではなく、同意とオプトアウトに関するものです。
additional_emails の難読化は、正直に読むべき信号です。BBB はその列を大量収集しにくくするために意図的な手を打っています。デコードを妨げるものは何もありませんし、このページはその方法も書いていますが、節度を保つべきだという合図として受け取ってください。実際に連絡する候補リストと、かき集めた配信リストは別物です。BBB の規約が同サイトへの自動アクセスを定めています。規模を広げる前にお読みください。データ層でサードパーティのトラッカーは動かしておらず、エクスポートは 30 日で自動的に削除されます。
最もよくいただく質問です。ほかにもあれば お問い合わせください。回答を書いているのは人であって、ボットではありません。
BBB 企業スクレイパーは、Better Business Bureau の名簿をスプレッドシートに変えます。素の検索語、BBB のカテゴリ URL、あるいは設定した地域フィルターを含む完全な bbb.org/search URL を - 1 行に 1 件、自由に混ぜて、または CSV、XLSX、TXT、Parquet ファイルとしてアップロードして - 送信し、必要なら上限を設定すると、各企業が 1 行として返ります。名称、BBB の文字評価、認定の有無、2 階層のカテゴリ、部分に分かれた住所、電話とファクス、ウェブサイトとメール、営業年数、対応地域、そしてプロフィール画像。企業 1 社につき 1 行で、CSV、Excel、JSON としてダウンロードできます。このサービスに並べ替えの設定はありません。実行を形づくるのはクエリと上限です。
これに対してコードを書く前に理解しておくべき挙動は、このエクスポートがキーを空にせず省くということです。 企業がある項目を公開していない場合、その列は行から丸ごと消えますし、読んだ行を通して 1 つのファイルの中に何十通りものキーの組み合わせがありました。毎回存在するのはごくわずかです。クエリ、プロフィール URL、名称、主たる業種、電話、市、州、郵便番号、そして認定のフラグ。CSV や Excel のダウンロードではこれは見えません。列が揃い、欠けた部分は空のセルになるからです。JSON では空文字と undefined の違いになります。防御的に読むか、表計算を取って正規化を任せてください。
ざっと読むと誤解を招く名前の列が 2 つあります。rating は BBB 自身の文字評価 - A+ のような文字列 - であって顧客の点数ではありません。顧客の星の平均は average_rating で、1 から 5 の数値、reviews_total と一緒に現れ、レビューのある企業にだけ付きます。当社の BBB 企業レビュースクレイパーも使うなら、あちらでは rating が星の点数を意味する点にご注意ください。同じ語が 2 つのページで別のものを指します。それ以外の形式は一貫しており、推測ではなく計測したものです。accredited は真偽値ではなく Yes か No の文字列、service_area は郡と州の配列、images は配列ではなく単一のオブジェクト、all_categories は主たる category よりたいていはるかに広いカンマ連結の文字列、そして business_start は文字列として保持された年である一方、years_in_business は数値です。
1 つの列は意図的に崩された形で返ります。additional_emails は BBB 自身のスクレイピング対策の難読化を帯びており、@ を __at__、ドットを __dot__ と書く形が目印に挟まれています。この項目を持つ行はすべてそうで、素の email 列は決してそうなりません。そうすべきだと分かってしまえば、元に戻すのは機械的です。宣言済み 32 列のうち 2 つ、licenses と social_media は私たちが実行した限りでは現れなかったため、このページは 30 列を記載し、そのことを述べています。値を一度も見ていない項目を説明するより、そのほうが誠実だからです。法的な面では、これらは公開された企業の掲載情報ですが、エクスポートには名前のある担当者と直接の連絡先が含まれ、小規模事業者の掲載住所はしばしば誰かの自宅です - 個人データとして扱い、営業目的で使うなら、入手方法にかかわらず独自のマーケティング規則が伴うことを忘れないでください。規模を広げる前に BBB の規約をお読みください。無料で始められます。最初の 500 行は無料でカードも不要、それ以降は 1 行あたり 0.002 ドルの一律料金です。現在の料金は料金ページをご覧ください。