入力は、サイト自体に打ち込むのと同じ 2 つ - 何がほしいか、そしてどこで。
両方の入力はどの行にも残り、search, location という形の 1 つの query 値としてまとめられます。複数の検索が混ざったファイルでも、あとから切り分けられます。
ディレクトリ由来のフィールドは行の最初の 3 分の 1 にすぎません。残りはエンリッチメントです。到達可能性の判定付きメールアドレス、ソーシャルプロフィール、そして事業者自身のウェブサイトから読み取った詳細。
アドレスは単独ではなくステータスと一緒に届くので、誰かが配信ツールに読み込む前に、送る価値のあるものまでリストを絞り込めます。
営業時間は文章ではなく Mo-Fr 09:00-18:00, Sa 09:00-15:00 の形で届きます。解釈しなければならない文ではなく、パースできる形です。
このエクスポートには実データがあるので、このページは形式について具体的に書けます。同時に、パイプラインを静かに壊す性質が 1 つあり、それは表の前に 2 段落を割く価値があります。
列の順序は実行ごとに安定していません。手元のどの実行も同じ 63 の名前を持っていますが、いつも同じ並びで届くわけではありません - ある実行では hours が 20 番目ではなく最後から 2 番目にあり、その後ろの列が 1 つずつずれていました。追加も削除も改名もされておらず、動いたのは順序だけです。
列名で読んでいるなら無害ですが、位置で読んでいるなら破壊的です。先週 amenities だったからという理由で 20 列目を amenities として扱うローダーは、そのフィールドに営業時間を書き込み、エラーを一度も出しません。取り込みのたびにヘッダー行を名前で対応づけてください。ツールの都合でそれがやりにくいのなら、最初の本番実行の後ではなく前に直しておく価値がある唯一の点がこれです。
実際の実行のヘッダー行と JSON キーから取ったもので、両者は一致しています。以下の形式は値の入ったセルから測ったものです。列に決まった形があればそれを示し、なければ作り出しません。
(212) 473-4444 の形 - 丸括弧、空白、そしてハイフン。categories をカンマと空白でつないだものなので、両者は同じ事実の二重掲載です。都合のよい方を採り、もう一方は無視してください。reviews_count は常に一緒に来ます - 掲載は両方持つか、どちらも持たないかです。open now、closed now、opening soon、open 24 hours。実行全体ではなく、その行自身の scraped_at と突き合わせて読んでください。下の注記をご覧ください。email_1 から email_3 と emails に入るので、連絡先アドレスとして読むべきはそちらの列です。Mo-Fr 09:00-18:00, Sa 09:00-15:00 というコンパクトな形の営業時間 - 2 文字の曜日コード、範囲はカンマでつながれます。emails の各アドレスに 1 件ずつ対応し、それぞれカンマでつないだ 2 つの部分から成ります。到達可能性の判定、そして詳細です。詳細は固定された語彙ではなく、メールボックスの種類を示すこともドメインをそのまま返すこともあるので、カンマの前の部分で分岐し、残りは自由テキストとして扱ってください。<title>。phone にある番号を繰り返すことがあるので、どこかに電話をかける前にその列と突き合わせて重複を除いてください。phones_extra の各要素に対応する回線種別。位置がそろっており長さも常に同じですが、種別を判定できなかった要素は null になりえますので、添字アクセスは慎重に。phone の回線種別。contact_name に対応する役職。2026-07-06 09:16:41.954000 の形です。これは 1 回の実行の中でも変わります - 1 つのファイルの行がすべて同じ瞬間に読まれたわけではなく、それこそが open_status を行ごとの事実にしています。search, location としてつないだもの。そこから生じたすべての行に繰り返し入ります。email_2 を持つ行はありません。このエクスポートは位置ではなく列名で読んでください。どの実行も同じ 63 の名前を持ちますが、順序は固定されていません。手元のある実行では hours が 20 番目ではなく最後から 2 番目に届き、その後ろがすべて 1 つずつずれていました。改名も削除もされていないため、位置で読むローダーは営業時間を設備欄に書き込んだうえで「成功」と報告したはずです。2 つ目に知っておくべきなのは、scraped_at が 1 つのファイルの中でも変わることです。行がすべて同じ瞬間に取得されたわけではないため、open_status は行それぞれの瞬間を表しており、実行全体の性質ではありません。そして驚く前に処理しておきたい小さな形が 3 つ。category は categories をカンマでつないだだけの同じ事実の二重掲載であること。amenities は改行で区切って 2 つの値を 1 つの文字列に詰め込めること。そして phones_extra_types は phones_extra と添字ごとに対応する一方、種別が判定できなかった位置には null が入りうることです。
設定は 4 つ、そしてそれが入力のすべてです。どこで探すか、何を探すか、どの地域か、どれだけ取るか。結果の横にある並べ替えと絞り込みのボタンは表示用の操作です - 見ているものを整えるだけで、実行が取ってくるものは変えません。
チームがディレクトリの掲載情報を使って、実際に抱えている問いに答えている例をいくつか。
カテゴリーと都市が掲載情報を生み、エンリッチメントの列が連絡手段を生みます。どのアドレスにも到達可能性の判定が付いてくるので、バウンスが返ってきてからではなく、配信ツールに渡す前にリストを絞り込めます。
評価、レビュー件数、営業年数が同じ行に並びます。それだけで、混み合った市場と手薄な市場、新規参入と老舗を見分けられます - 掲載を 1 件も手で開くことなく。
サイト関連の列が、各サイトを何で作ったか、Facebook ピクセルや Google タグを載せているかを教えてくれます。あるプラットフォームの利用者に売る立場なら、それはディレクトリを見込み度の高いリストに変えます。
サブスクリプションも、最低利用額も、毎月の請求もありません。最初の 500 行は当社負担です。その後は従量課金で、ここにある他のスクレイパーとまったく同じ均一料金です。
新規アカウントごとに初回 1 回。クレジットカード不要。レコード数の上限とすべての書き出し形式を含みます。
掲載 1,000 件でおよそ 2 ドル。エンリッチメントの列は別工程として課金されるのではなく含まれています。事前の見積り表示が、実行を開始する前に行数とクレジット費用を示します。
継続的なモニタリングや非常に大きな過去データの取得のための、ボリューム料金、専用ワーカー、SLA。ご要望の規模をお知らせいただければお見積りします。
LIVESCRAPER10 をご利用ください。短い答え:掲載内容についてははい。ただしこのエクスポートは連絡先データと到達可能性の判定を含んでおり、注意を要するのはその部分です。
Yellow Pages の掲載は見つけてもらうために存在します。名称、電話、住所、カテゴリー、営業時間、評価は、ログインの有無にかかわらず検索した誰にでも表示され、公開されている事業者情報を市場調査のために収集することは長く確立された実務です。ここではログインにもアカウントにも有料の壁にも触れていません。
注意が必要なのはエンリッチメントです。このエクスポートはディレクトリで止まりません。メールアドレス、それに結び付いた人物、回線種別付きの追加電話番号、ソーシャルプロフィールを加えます。会社ドメイン上の会社宛アドレスは、多くの解釈では業務上の連絡先です - しかし氏名の分かる個人のアドレスは、どこで公開されていたかにかかわらず EU と英国では個人データであり、emails_persons はまさに個人を名指しするために存在します。アウトリーチを行うなら、法的根拠とオプトアウトはあなたの責任であり、emails_status の到達可能性の判定が教えてくれるのはメッセージが届くかどうかであって、送ってよいかどうかではありません。両者は無関係であり、頭の中でも分けておく価値があります。
あなたの問いが連絡ではなく市場構造 - 何件あるか、どれだけ根付いているか、評価はどうか - であるなら、取り込み時にメール・電話・人物の列を捨ててください。そうすればこの大部分はあなたの問題ではなくなります。当社はデータ層でサードパーティのトラッカーを一切動かしておらず、書き出したファイルは 30 日で自動的に削除されます。Yellow Pages の規約は自動アクセスを制限しているので、規模を広げる前に確認してください。
最もよくいただく質問です。ほかにもあれば ご連絡ください - 回答を書いているのはボットではなく人間です。
Livescraper の Yellow Pages Search スクレイパーは、カテゴリーと地域をリードの表に変えます。地域を選び、何を探しているかとどこで探すかを入力し、必要ならレコード数に上限をかけて、結果をきれいな CSV、Excel、JSON としてダウンロードします。1 件につき 1 行が返り、2 つの入力はどの行にも 1 つの query 値として載るため、複数の検索が混ざったファイルでも切り分けられます。
各行は 63 列を運びます。ディレクトリ側は、事業者名、電話、番地、市、州、郵便番号、配列と連結文字列の両方でのカテゴリー、評価とレビュー件数、コンパクトで機械可読な形の営業時間、説明の抜粋、画像、そして掲載へ戻るリンク。エンリッチメント側は、到達可能性の判定付きメールアドレス、それに結び付いた人物、回線種別付きの追加電話番号、ソーシャルプロフィール、そして事業者自身のサイトから読み取った詳細 - タイトル、説明、キーワード、何で作られたか、Facebook ピクセルや Google タグを載せているか。
営業チームは一度の実行で連絡可能なリストを作り、何かが配信ツールに届く前に到達可能性の判定で絞り込みます。調査に携わる人は、評価、レビュー件数、営業年数を並べて、混み合った地域市場と手薄な市場を見分けます。市場投入チームはサイト関連の列で絞り込み、特定のプラットフォームを使っている事業者を見つけます。
土台にする前に注意すべき性質が 1 つあります。列の順序は実行ごとに安定していません。どの実行も同じ 63 の名前を持ちますが、手元のある実行では hours 列が 20 番目ではなく最後から 2 番目に届き、その後ろの列が 1 つずつずれていました。改名も削除もされていないからこそ、位置で読むローダーは静かに誤って対応づけ、成功と報告します - 取り込みのたびにヘッダー行を名前で対応づけてください。もう 1 つ知っておくとよいのは、scraped_at が 1 つのファイルの中でも変わることで、open_status は実行全体ではなく行それぞれの瞬間を表します。無料で始められます。最初の 500 行は費用もクレジットカードも不要で、その後は 1 行 0.002 ドルの均一料金です。