Yellow Pages Search スクレイパー

カテゴリーと都市を、
リードの表に

何を探しているかと、どこで探すかを入力すると、掲載情報が行データで返ります。名称、電話、番地、カテゴリー、評価とレビュー件数、営業時間、ウェブサイト - そしてエンリッチメントが成功した場合は、到達可能性の判定が付いた連絡先メールアドレス、ソーシャルプロフィール、サイト自体から読み取った詳細まで。63 列、1 件につき 1 行。

初回のみ 500 行無料以降 1 行 0.002 ドル63 列CSV · XLSX · JSON
使い方

2 つの欄を入れると、
リードの表が出てくる

入力は、サイト自体に打ち込むのと同じ 2 つ - 何がほしいか、そしてどこで。

  1. ステップ 1プラットフォームにサインインします。
  2. ステップ 2Yellow Pages Search スクレイパーを開きます。
  3. ステップ 3地域を選びます。
  4. ステップ 4検索語と地域を入力します。
  5. ステップ 5レコード数の上限を設定します。空欄にすれば取得できるものをすべて取ります。
  6. ステップ 6Start scraping をクリックします。

両方の入力はどの行にも残り、search, location という形の 1 つの query 値としてまとめられます。複数の検索が混ざったファイルでも、あとから切り分けられます。

チームが使う理由

ディレクトリの掲載情報が、
すでに補強済み

掲載情報、そしてその先のすべて

ディレクトリ由来のフィールドは行の最初の 3 分の 1 にすぎません。残りはエンリッチメントです。到達可能性の判定付きメールアドレス、ソーシャルプロフィール、そして事業者自身のウェブサイトから読み取った詳細。

判定付きで届くメールアドレス

アドレスは単独ではなくステータスと一緒に届くので、誰かが配信ツールに読み込む前に、送る価値のあるものまでリストを絞り込めます。

機械が読める形の営業時間

営業時間は文章ではなく Mo-Fr 09:00-18:00, Sa 09:00-15:00 の形で届きます。解釈しなければならない文ではなく、パースできる形です。

取得できるもの

63 列 -
そして先に直すべき 1 点

このエクスポートには実データがあるので、このページは形式について具体的に書けます。同時に、パイプラインを静かに壊す性質が 1 つあり、それは表の前に 2 段落を割く価値があります。

列の順序は実行ごとに安定していません。手元のどの実行も同じ 63 の名前を持っていますが、いつも同じ並びで届くわけではありません - ある実行では hours が 20 番目ではなく最後から 2 番目にあり、その後ろの列が 1 つずつずれていました。追加も削除も改名もされておらず、動いたのは順序だけです。

列名で読んでいるなら無害ですが、位置で読んでいるなら破壊的です。先週 amenities だったからという理由で 20 列目を amenities として扱うローダーは、そのフィールドに営業時間を書き込み、エラーを一度も出しません。取り込みのたびにヘッダー行を名前で対応づけてください。ツールの都合でそれがやりにくいのなら、最初の本番実行の後ではなく前に直しておく価値がある唯一の点がこれです。

データ辞書

63 列、
名前で読む

実際の実行のヘッダー行と JSON キーから取ったもので、両者は一致しています。以下の形式は値の入ったセルから測ったものです。列に決まった形があればそれを示し、なければ作り出しません。

name
掲載が示す事業者名。
phone
主電話番号。常に (212) 473-4444 の形 - 丸括弧、空白、そしてハイフン。
category
カテゴリーを 1 本の文字列にしたもの。これはちょうど categories をカンマと空白でつないだものなので、両者は同じ事実の二重掲載です。都合のよい方を採り、もう一方は無視してください。
categories
同じカテゴリーを配列にしたもの。絞り込みに使うのはこちらです。
area
住所の番地部分。市・州・郵便番号はその隣にそれぞれ独立した列があります。
city
市。
state
州。常に大文字 2 字。
pincode
郵便番号。常に 5 桁。
range
掲載が持ちうる価格帯の表示。
rating
平均評価。文字列に入った数値です。これと reviews_count は常に一緒に来ます - 掲載は両方持つか、どちらも持たないかです。
reviews_count
その平均が何件のレビューに基づいているか。
open_status
その行が取得された時点で営業していたかどうか - open nowclosed nowopening soonopen 24 hours。実行全体ではなく、その行自身の scraped_at と突き合わせて読んでください。下の注記をご覧ください。
email
単一アドレス用のメール欄。エンリッチメントの出力は email_1 から email_3emails に入るので、連絡先アドレスとして読むべきはそちらの列です。
website
事業者自身のサイト。以下のサイト由来の列は、これが埋まっていない限りすべて空のままです - ただしサイトが埋まっていても、それらが解決した保証にはなりません。
directions
掲載の経路案内ページへのリンク。
image
掲載のサムネイル画像へのリンク。
years_in_business
掲載が示す営業年数。整数です。
description
短く切り詰められた抜粋。会社紹介文ではなくプレビューとして扱ってください。事業者自身の紹介文である場合もあれば、顧客レビューである場合もあり、だからこそ文の途中や引用符の切れ端で終わることがあります。
source_url
その行を読み取った掲載ページ。値を手作業で確かめる必要が出たときのために残しておくべき列です。
hours
Mo-Fr 09:00-18:00, Sa 09:00-15:00 というコンパクトな形の営業時間 - 2 文字の曜日コード、範囲はカンマでつながれます。
amenities
掲載が掲げる設備・特徴。2 つの項目が改行で区切られて 1 つの値に入ることがありますので、単一のラベルだと決めつけず改行で分割してください。
facebook
事業者の Facebook ページへのリンク。
instagram
事業者の Instagram プロフィールへのリンク。
linkedin
事業者の LinkedIn ページへのリンク。
tiktok
事業者の TikTok プロフィールへのリンク。
medium
事業者の Medium パブリケーションへのリンク。
reddit
事業者の Reddit 上の活動へのリンク。
skype
事業者の Skype ID。
snapchat
事業者の Snapchat プロフィールへのリンク。
telegram
事業者の Telegram 上の活動へのリンク。
whatsapp
事業者の WhatsApp 連絡先。
twitter
事業者の X/Twitter プロフィールへのリンク。
vimeo
事業者の Vimeo チャンネルへのリンク。
youtube
事業者の YouTube 上の所在へのリンク - チャンネル、ユーザーページ、あるいは単一の動画のこともあるので、チャンネル URL だと決めつけないでください。
github
事業者の GitHub organization へのリンク。
crunchbase
事業者の Crunchbase プロフィールへのリンク。
emails
エンリッチメントが見つけたすべてのアドレス。配列です。
emails_status
emails の各アドレスに 1 件ずつ対応し、それぞれカンマでつないだ 2 つの部分から成ります。到達可能性の判定、そして詳細です。詳細は固定された語彙ではなく、メールボックスの種類を示すこともドメインをそのまま返すこともあるので、カンマの前の部分で分岐し、残りは自由テキストとして扱ってください。
website_title
事業者サイトの <title>
website_description
事業者サイトの meta description。
website_keywords
事業者サイトの meta keywords。
website_generator
サイトを何で作ったか。generator タグから読み取ったもので、CMS、ページビルダー、SEO プラグインなど、多くの場合バージョン文字列付きです。
website_has_fb_pixel
サイトに Facebook ピクセルが見つかったかどうか。文字列ではなく本物の真偽値です。
website_has_google_tag
サイトに Google タグが見つかったかどうか。こちらも本物の真偽値です。
phones_extra
その事業者について見つかった追加の電話番号。配列です。すでに phone にある番号を繰り返すことがあるので、どこかに電話をかける前にその列と突き合わせて重複を除いてください。
phones_extra_types
phones_extra の各要素に対応する回線種別。位置がそろっており長さも常に同じですが、種別を判定できなかった要素は null になりえますので、添字アクセスは慎重に。
phone_type
主電話番号 phone の回線種別。
contact_name
エンリッチメント由来の連絡先名。これが個人だと決めつけないでください - 値は個人名と同じくらいの頻度で診療所名や会社名であり、姓と名に分割するのは安全ではありません。
contact_title
contact_name に対応する役職。
is_public
その企業が上場しているかどうか。本物の真偽値です。
wp_name
電話データ提供元が保持している企業名。
wp_address
電話データ提供元が保持している住所。
phones_extra_wp
電話データ提供元による追加の電話番号。
emails_persons
エンリッチメントが見つけたアドレスに結び付けた人物。配列です。
employees
企業の従業員数。数値です。
scraped_at
その行が取得された時刻。2026-07-06 09:16:41.954000 の形です。これは 1 回の実行の中でも変わります - 1 つのファイルの行がすべて同じ瞬間に読まれたわけではなく、それこそが open_status を行ごとの事実にしています。
query
あなたの 2 つの入力を search, location としてつないだもの。そこから生じたすべての行に繰り返し入ります。
position
結果順における掲載の位置。1 から始まり、1 回の実行の中で一意です。返ってきたとおりの順位を再現するために並べ替える列です。
email_1
1 つ目のエンリッチ済みメールアドレス。これなしに email_2 を持つ行はありません。
email_2
2 つ目のエンリッチ済みメールアドレス(あれば)。
email_3
3 つ目のエンリッチ済みメールアドレス(あれば)。
industry
企業レベルのエンリッチメントが割り当てる業種。
founded_year
企業の設立年。数値です。

このエクスポートは位置ではなく列名で読んでください。どの実行も同じ 63 の名前を持ちますが、順序は固定されていません。手元のある実行では hours が 20 番目ではなく最後から 2 番目に届き、その後ろがすべて 1 つずつずれていました。改名も削除もされていないため、位置で読むローダーは営業時間を設備欄に書き込んだうえで「成功」と報告したはずです。2 つ目に知っておくべきなのは、scraped_at が 1 つのファイルの中でも変わることです。行がすべて同じ瞬間に取得されたわけではないため、open_status は行それぞれの瞬間を表しており、実行全体の性質ではありません。そして驚く前に処理しておきたい小さな形が 3 つ。categorycategories をカンマでつないだだけの同じ事実の二重掲載であること。amenities は改行で区切って 2 つの値を 1 つの文字列に詰め込めること。そして phones_extra_typesphones_extra と添字ごとに対応する一方、種別が判定できなかった位置には null が入りうることです。

実行の設定

設定はジョブ側で、
表計算ソフトではなく

設定は 4 つ、そしてそれが入力のすべてです。どこで探すか、何を探すか、どの地域か、どれだけ取るか。結果の横にある並べ替えと絞り込みのボタンは表示用の操作です - 見ているものを整えるだけで、実行が取ってくるものは変えません。

地域 検索語 場所 上限(レコード数) 空欄ですべて取得 1 件につき 1 行 CSV 書き出し XLSX 書き出し JSON 書き出し
よくある使い方

ここで最も多く
実行される 3 つの仕事。

チームがディレクトリの掲載情報を使って、実際に抱えている問いに答えている例をいくつか。

リード獲得

一度の実行で連絡可能なリストを作る

カテゴリーと都市が掲載情報を生み、エンリッチメントの列が連絡手段を生みます。どのアドレスにも到達可能性の判定が付いてくるので、バウンスが返ってきてからではなく、配信ツールに渡す前にリストを絞り込めます。

リード獲得 · 営業
市場把握

地域の業種規模を測り、誰が根付いているかを見る

評価、レビュー件数、営業年数が同じ行に並びます。それだけで、混み合った市場と手薄な市場、新規参入と老舗を見分けられます - 掲載を 1 件も手で開くことなく。

調査
技術スタック

特定の構成を使っている事業者を見つける

サイト関連の列が、各サイトを何で作ったか、Facebook ピクセルや Google タグを載せているかを教えてくれます。あるプラットフォームの利用者に売る立場なら、それはディレクトリを見込み度の高いリストに変えます。

市場投入
料金

実際に取り出した
掲載の分だけ、お支払い

サブスクリプションも、最低利用額も、毎月の請求もありません。最初の 500 行は当社負担です。その後は従量課金で、ここにある他のスクレイパーとまったく同じ均一料金です。

無料枠

500 行無料 - 0 ドル

新規アカウントごとに初回 1 回。クレジットカード不要。レコード数の上限とすべての書き出し形式を含みます。

ずっと 0 ドル
従量課金

無料枠のあとは 1 行 0.002 ドル

掲載 1,000 件でおよそ 2 ドル。エンリッチメントの列は別工程として課金されるのではなく含まれています。事前の見積り表示が、実行を開始する前に行数とクレジット費用を示します。

最も選ばれています
大量利用

カスタム · 大量利用

継続的なモニタリングや非常に大きな過去データの取得のための、ボリューム料金、専用ワーカー、SLA。ご要望の規模をお知らせいただければお見積りします。

ご相談ください
初回の有料実行が 10% オフ。お支払い時にコード LIVESCRAPER10 をご利用ください。
登録する
相性のよい組み合わせ

1 つのディレクトリと、
その隣

法的な話

Yellow Pages
スクレイピングするのは合法か。

短い答え:掲載内容についてははい。ただしこのエクスポートは連絡先データと到達可能性の判定を含んでおり、注意を要するのはその部分です。

Yellow Pages の掲載は見つけてもらうために存在します。名称、電話、住所、カテゴリー、営業時間、評価は、ログインの有無にかかわらず検索した誰にでも表示され、公開されている事業者情報を市場調査のために収集することは長く確立された実務です。ここではログインにもアカウントにも有料の壁にも触れていません。

注意が必要なのはエンリッチメントです。このエクスポートはディレクトリで止まりません。メールアドレス、それに結び付いた人物、回線種別付きの追加電話番号、ソーシャルプロフィールを加えます。会社ドメイン上の会社宛アドレスは、多くの解釈では業務上の連絡先です - しかし氏名の分かる個人のアドレスは、どこで公開されていたかにかかわらず EU と英国では個人データであり、emails_persons はまさに個人を名指しするために存在します。アウトリーチを行うなら、法的根拠とオプトアウトはあなたの責任であり、emails_status の到達可能性の判定が教えてくれるのはメッセージが届くかどうかであって、送ってよいかどうかではありません。両者は無関係であり、頭の中でも分けておく価値があります。

あなたの問いが連絡ではなく市場構造 - 何件あるか、どれだけ根付いているか、評価はどうか - であるなら、取り込み時にメール・電話・人物の列を捨ててください。そうすればこの大部分はあなたの問題ではなくなります。当社はデータ層でサードパーティのトラッカーを一切動かしておらず、書き出したファイルは 30 日で自動的に削除されます。Yellow Pages の規約は自動アクセスを制限しているので、規模を広げる前に確認してください。

livescraper.app · 方針
公開されている事業者掲載のみ
ログインなし、アカウントに触れない
エンリッチされたメールと人物は個人データ
到達可能であることと許されていることは別
書き出しは自動削除(30 日)
規模を広げる前に Yellow Pages 自身の規約を確認してください。
よくある質問

登録する前に
よく聞かれること。

最もよくいただく質問です。ほかにもあれば ご連絡ください - 回答を書いているのはボットではなく人間です。

Yellow Pages はどうやってスクレイピングしますか。+
Yellow Pages Search スクレイパーを使います。
  1. プラットフォームにサインインします。
  2. Yellow Pages Search スクレイパーを開きます。
  3. 地域を選びます。
  4. 検索語と地域を入力します。
  5. レコード数の上限を設定します。空欄にすれば取得できるものをすべて取ります。
  6. Start scraping をクリックします。
ローダーが列に誤ったデータを入れるのはなぜですか。+
位置で読んでいるからです。どの実行も同じ 63 の列名を持ちますが、順序は実行間で固定されていません。手元のある実行では hours 列が 20 番目ではなく最後から 2 番目に届き、その後ろがすべて 1 つずつずれていました。改名も削除もされていないため、位置で読むローダーは静かに誤って対応づけ、成功と報告します。取り込みのたびにヘッダー行を名前で対応づければ、この問題は消えます。
1 件の掲載から何が返りますか。+
63 列です。ディレクトリ由来のフィールドは、名称、電話、番地、市、州、郵便番号、カテゴリー、評価とレビュー件数、営業時間、価格帯、説明の抜粋、画像、そして掲載へのリンク。残りはエンリッチメントです。到達可能性の判定付きメールアドレス、それに結び付いた人物、回線種別付きの追加電話番号、ソーシャルプロフィール、そして何で作られたかを含む事業者自身のウェブサイトから読み取った詳細。そのすべてが JSON だけでなく CSV と XLSX にも入ります。
open_status は信頼できますか。+
その行が取得された瞬間については正確ですが、それは実行が終わった瞬間とは違います。scraped_at 列は 1 つのファイルの中でも変わります。行がすべて同じ瞬間に読まれたわけではないからで、open now と closed now は行ごとの事実です。open_status はその行自身の scraped_at と突き合わせて読み、営業時間をスナップショットではなく事業者の性質として必要とするなら、代わりに hours 列を使ってください。
メールアドレスとそのステータスはどんな形式ですか。+
アドレスは emails に配列として届き、さらに email_1、email_2、email_3 に展開されます。この段は一貫していて、1 つ目なしに 2 つ目を持つ行も、2 つ目なしに 3 つ目を持つ行もありません。emails_status の各要素はカンマでつないだ 2 つの部分から成ります。到達可能性の判定、そして詳細です。詳細は固定された語彙ではなく、メールボックスの種類を示すこともドメインをそのまま返すこともあるので、カンマの前の部分で分岐し、残りは自由テキストとして扱ってください。
contact_name を姓と名に分割できますか。+
安全にはできません。値は個人名と同じくらいの頻度で診療所名や会社名であり、空白で分割すればどんなリストでもかなりの割合で無意味な結果になります。人物単位のフィールドが必要なら emails_persons を読み、contact_name は名前ではなくラベルとして扱ってください。
どの地域に対応していますか。+
フォームに地域の選択欄があり、パーサーがまだ扱えない項目には印が付きます。それらにはサイトのレイアウトが異なる旨の警告が表示されます。一覧は事前に固定されているのではなくページを開いたときに読み込まれるので、このページから一覧を写すのではなく、選択欄でご自身に利用できるものを確認してください。既定は米国のサイトです。
費用はいくらですか。+
最初の 500 行は初回 1 回かぎり無料で、クレジットカードも不要です。それ以降は 1 行 0.002 ドル - 掲載 1,000 件でおよそ 2 ドル - で、プラットフォーム上の他のどのスクレイパーとも同じ均一料金です。エンリッチメントの列は別工程として課金されるのではなく含まれています。実行を開始する前に、見積り表示がその費用を示します。

最初の 500 件の掲載は、
当社のおごりです

新規アカウントごとに初回 1 回かぎりの無料 500 行 - 有効期限はありません。その後は 1 行 0.002 ドルの従量課金で、あなたが望むまでカード情報を登録する必要はありません。

すぐに有効 · カード不要

Yellow Pages の掲載情報を大規模にスクレイピングする

Livescraper の Yellow Pages Search スクレイパーは、カテゴリーと地域をリードの表に変えます。地域を選び、何を探しているかとどこで探すかを入力し、必要ならレコード数に上限をかけて、結果をきれいな CSV、Excel、JSON としてダウンロードします。1 件につき 1 行が返り、2 つの入力はどの行にも 1 つの query 値として載るため、複数の検索が混ざったファイルでも切り分けられます。

各行は 63 列を運びます。ディレクトリ側は、事業者名、電話、番地、市、州、郵便番号、配列と連結文字列の両方でのカテゴリー、評価とレビュー件数、コンパクトで機械可読な形の営業時間、説明の抜粋、画像、そして掲載へ戻るリンク。エンリッチメント側は、到達可能性の判定付きメールアドレス、それに結び付いた人物、回線種別付きの追加電話番号、ソーシャルプロフィール、そして事業者自身のサイトから読み取った詳細 - タイトル、説明、キーワード、何で作られたか、Facebook ピクセルや Google タグを載せているか。

営業チームは一度の実行で連絡可能なリストを作り、何かが配信ツールに届く前に到達可能性の判定で絞り込みます。調査に携わる人は、評価、レビュー件数、営業年数を並べて、混み合った地域市場と手薄な市場を見分けます。市場投入チームはサイト関連の列で絞り込み、特定のプラットフォームを使っている事業者を見つけます。

土台にする前に注意すべき性質が 1 つあります。列の順序は実行ごとに安定していません。どの実行も同じ 63 の名前を持ちますが、手元のある実行では hours 列が 20 番目ではなく最後から 2 番目に届き、その後ろの列が 1 つずつずれていました。改名も削除もされていないからこそ、位置で読むローダーは静かに誤って対応づけ、成功と報告します - 取り込みのたびにヘッダー行を名前で対応づけてください。もう 1 つ知っておくとよいのは、scraped_at が 1 つのファイルの中でも変わることで、open_status は実行全体ではなく行それぞれの瞬間を表します。無料で始められます。最初の 500 行は費用もクレジットカードも不要で、その後は 1 行 0.002 ドルの均一料金です。