Scraper de Busca do Yellow Pages

Uma categoria e uma cidade,
como tabela de leads.

Escreva o que procura e onde, e receba os registos como linhas: o nome, o telefone, a rua, as categorias, a classificação e o número de avaliações, os horários, o site - e, onde o enriquecimento resolve, e-mails de contacto com um veredicto de entregabilidade, perfis sociais e detalhes lidos do próprio site. Sessenta e três colunas, uma linha por registo.

500 linhas grátis, uma única vezdepois 0,002 $ por linha63 colunasCSV · XLSX · JSON
Como funciona

Duas caixas à entrada,
uma tabela de leads à saída.

A entrada são as mesmas duas coisas que escreveria no próprio site - o que quer e onde o quer.

  1. PASSO 1Inicie sessão na plataforma.
  2. PASSO 2Abra o Yellow Pages Search Scraper.
  3. PASSO 3Escolha a região.
  4. PASSO 4Escreva o termo de pesquisa e a localidade.
  5. PASSO 5Defina um limite de registos, ou deixe-o vazio para levar tudo o que houver.
  6. PASSO 6Clique em Start scraping.

Ambos os campos acabam em cada linha, unidos num único valor query na forma search, location, por isso um ficheiro que misture várias pesquisas continua separável depois.

Porque as equipas o usam

Um registo de diretório,
já enriquecido.

O registo, e depois tudo o que vem a seguir

Os campos de diretório são apenas o primeiro terço da linha. O resto é enriquecimento: e-mails com veredicto de entregabilidade, perfis sociais e detalhes lidos do próprio site do negócio.

E-mails que vêm com um veredicto

Os endereços chegam acompanhados de um estado em vez de sozinhos, por isso uma lista pode ser reduzida ao que vale a pena contactar antes de alguém a carregar numa ferramenta de envio.

Horários em forma legível por máquina

Os horários chegam como Mo-Fr 09:00-18:00, Sa 09:00-15:00 e não em prosa - uma forma que pode analisar em vez de uma frase que tem de interpretar.

O que recebe

Sessenta e três colunas -
e uma coisa a resolver primeiro.

Esta exportação tem dados reais, por isso esta página pode ser específica quanto a formatos. Tem também uma propriedade que corrompe uma pipeline em silêncio, e ela merece dois parágrafos antes da tabela.

A ordem das colunas não é estável entre execuções. Todas as execuções que temos trazem os mesmos sessenta e três nomes, mas nem sempre chegam na mesma sequência - numa delas hours ficou em penúltimo lugar em vez de vigésimo, e as colunas seguintes deslocaram-se uma posição. Nada foi acrescentado, removido ou renomeado; apenas a ordem se moveu.

Isso é inofensivo se ler por nome de coluna e destrutivo se ler por posição. Um carregador que toma a coluna 20 como amenities porque era amenities na semana passada vai encher esse campo com horários de abertura e nunca dará erro. Mapeie a linha de cabeçalho por nome em cada importação - e, se a sua ferramenta tornar isso incómodo, é esta a única coisa que vale a pena resolver antes da primeira execução a sério e não depois.

Dicionário de dados

Sessenta e três colunas,
lidas por nome.

Retiradas da linha de cabeçalho e das chaves JSON de execuções reais, que coincidem. Os formatos abaixo estão medidos em células preenchidas - onde uma coluna tem forma fixa, ela é dada; onde não tem, não se inventa.

name
O nome do negócio tal como o registo o mostra.
phone
O telefone principal, sempre na forma (212) 473-4444 - parênteses, um espaço e depois um hífen.
category
As categorias como uma só cadeia. É exatamente categories unido por vírgula e espaço, por isso as duas são o mesmo facto duas vezes - fique com a que lhe servir e ignore a outra.
categories
As mesmas categorias como array, que é a forma por onde filtrar.
area
A linha de rua da morada. Cidade, estado e código postal têm colunas próprias ao lado.
city
A cidade.
state
O estado, sempre duas letras maiúsculas.
pincode
O código postal, sempre cinco dígitos.
range
O indicador de escalão de preços que o registo pode trazer.
rating
A classificação média, como número dentro de uma cadeia. Ela e reviews_count chegam sempre juntas - um registo tem as duas ou nenhuma.
reviews_count
Sobre quantas avaliações essa média é construída.
open_status
Se o negócio estava aberto no momento em que essa linha foi capturada - open now, closed now, opening soon, open 24 hours. Leia-o contra o scraped_at dessa linha, não contra a execução; veja a nota abaixo.
email
O campo de e-mail único. A saída do enriquecimento aterra em email_1 a email_3 e em emails, que são as colunas a ler para endereços de contacto.
website
O site do próprio negócio. Todas as colunas derivadas do site abaixo ficam vazias a não ser que esta esteja preenchida - ainda que um site preenchido não garanta que tenham resolvido.
directions
Um link para a página de direções do registo.
image
Um link para a miniatura do registo.
years_in_business
Há quanto tempo o registo diz que o negócio opera, como número inteiro.
description
Um excerto curto, truncado. Trate-o como pré-visualização e não como texto institucional: alguns valores são a descrição do próprio negócio e outros são uma avaliação de cliente, e é por isso que um pode acabar a meio da frase ou numa aspa solta.
source_url
A página de registo de onde a linha foi lida. A coluna a guardar caso alguma vez precise de verificar um valor à mão.
hours
Horários na forma compacta Mo-Fr 09:00-18:00, Sa 09:00-15:00 - códigos de dia de duas letras, intervalos unidos por vírgulas.
amenities
Atributos que o registo anuncia. Dois atributos podem chegar num mesmo valor separados por uma quebra de linha, por isso divida por quebras de linha em vez de assumir uma única etiqueta.
facebook
Link para a página de Facebook do negócio.
instagram
Link para o perfil de Instagram do negócio.
linkedin
Link para a página de LinkedIn do negócio.
tiktok
Link para o perfil de TikTok do negócio.
medium
Link para a publicação do negócio no Medium.
reddit
Link para a presença do negócio no Reddit.
skype
O utilizador de Skype do negócio.
snapchat
Link para o perfil de Snapchat do negócio.
telegram
Link para a presença do negócio no Telegram.
whatsapp
O contacto de WhatsApp do negócio.
twitter
Link para o perfil de X/Twitter do negócio.
vimeo
Link para o canal de Vimeo do negócio.
youtube
Link para a presença do negócio no YouTube - um canal, uma página de utilizador ou um único vídeo, por isso não assuma um URL de canal.
github
Link para a organização do negócio no GitHub.
crunchbase
Link para o perfil do negócio no Crunchbase.
emails
Todos os endereços que o enriquecimento encontrou, como array.
emails_status
Uma entrada por endereço em emails, cada uma com duas partes unidas por vírgula: um veredicto de entregabilidade e depois um detalhe. O detalhe não é um vocabulário fixo - pode nomear o tipo de caixa de correio ou repetir um domínio -, por isso decida pela parte antes da vírgula e trate o resto como texto livre.
website_title
O <title> do site do negócio.
website_description
A meta descrição do site do negócio.
website_keywords
As meta keywords do site do negócio.
website_generator
Com que o site foi construído, lido da sua etiqueta generator - um CMS, um construtor de páginas ou um plugin de SEO, e muitas vezes com uma versão.
website_has_fb_pixel
Se foi encontrado um pixel do Facebook no site. Um booleano a sério, não uma cadeia.
website_has_google_tag
Se foi encontrada uma etiqueta do Google no site. Também um booleano a sério.
phones_extra
Mais telefones encontrados para o negócio, como array. Pode repetir o número que já está em phone, por isso desduplique contra essa coluna antes de ligar seja para onde for.
phones_extra_types
O tipo de linha de cada entrada em phones_extra, alinhado por posição e sempre do mesmo comprimento - mas uma entrada pode ser null onde o tipo não foi determinado, por isso indexe com cuidado.
phone_type
O tipo de linha do telefone principal phone.
contact_name
Um nome de contacto vindo do enriquecimento. Não assuma que é uma pessoa - os valores são tantas vezes o nome de um consultório ou de uma empresa como o de um indivíduo, por isso não é seguro dividi-lo em nome próprio e apelido.
contact_title
O cargo que acompanha contact_name.
is_public
Se a empresa é cotada em bolsa. Um booleano a sério.
wp_name
O nome da empresa tal como o fornecedor de dados telefónicos o tem.
wp_address
A morada tal como o fornecedor de dados telefónicos a tem.
phones_extra_wp
Mais telefones do fornecedor de dados telefónicos.
emails_persons
As pessoas que o enriquecimento associou aos endereços encontrados, como array.
employees
O número de colaboradores da empresa, como número.
scraped_at
Quando essa linha foi capturada, como 2026-07-06 09:16:41.954000. Isto varia dentro de uma única execução - as linhas de um ficheiro não foram todas lidas no mesmo instante, e é isso que faz de open_status um facto por linha.
query
As suas duas entradas unidas como search, location, repetidas em cada linha que delas resultou.
position
O lugar do registo na ordem dos resultados, começando em 1 e único dentro de uma execução. A coluna por onde ordenar para reconstruir a ordenação exatamente como foi devolvida.
email_1
O primeiro endereço de e-mail enriquecido. Nenhuma linha traz email_2 sem este.
email_2
O segundo endereço de e-mail enriquecido, quando existe.
email_3
O terceiro endereço de e-mail enriquecido, quando existe.
industry
O setor que o enriquecimento ao nível da empresa atribui.
founded_year
O ano de fundação da empresa, como número.

Leia esta exportação por nome de coluna, nunca por posição. Todas as execuções trazem os mesmos sessenta e três nomes, mas a ordem não é fixa - numa das nossas, hours chegou em penúltimo lugar em vez de vigésimo, e tudo o que vinha a seguir deslocou-se uma posição. Nada foi renomeado nem deixado de fora; um carregador posicional teria simplesmente escrito horários de abertura no campo dos atributos e reportado sucesso. A segunda coisa a saber é que scraped_at varia dentro de um único ficheiro, porque as linhas não foram todas capturadas no mesmo instante - por isso open_status descreve o momento próprio de cada linha e não é uma propriedade da execução. E três formas menores a tratar antes que surpreendam: category é apenas categories unido por vírgulas, ou seja o mesmo facto duas vezes; amenities pode meter dois valores numa cadeia separados por uma quebra de linha; e phones_extra_types alinha com phones_extra índice a índice mas pode conter um null onde o tipo não foi determinado.

Controlos de execução

Definido na tarefa,
não na folha de cálculo.

Quatro controlos, e são a totalidade da entrada: onde procurar, o que procurar, em que sítio e quanto levar. Os botões de ordenação e filtro ao lado dos resultados são controlos de vista - moldam o que está a ver, não o que a execução vai buscar.

Região Termo de pesquisa Localidade Limite (registos) Limite vazio leva tudo Uma linha por registo Exportação CSV Exportação XLSX Exportação JSON
Fluxos de trabalho comuns

Três tarefas que correm
aqui mais do que quaisquer outras.

Alguns exemplos de como as equipas usam registos de diretório para responder a uma pergunta que têm mesmo.

Geração de leads

Construir uma lista contactável numa só passagem

Uma categoria e uma cidade produzem os registos; as colunas de enriquecimento produzem a forma de lhes chegar. Como cada endereço chega com um veredicto de entregabilidade, a lista pode ser filtrada antes de chegar a uma ferramenta de envio em vez de depois de voltarem os bounces.

Geração de leads · Vendas
Mapa de mercado

Dimensionar um ofício local e ver quem está estabelecido

Classificação, número de avaliações e anos de atividade estão na mesma linha, e isso chega para distinguir um mercado cheio de um mercado magro e um recém-chegado de uma casa antiga - sem abrir um único registo à mão.

Investigação
Stack técnica

Encontrar negócios com uma configuração específica

As colunas do site dizem com que cada um foi construído e se traz um pixel do Facebook ou uma etiqueta do Google. Para quem vende aos utilizadores de uma plataforma, isso transforma um diretório numa lista qualificada.

Go-to-market
Preços

Pague só pelos registos
que realmente extrai.

Sem subscrição, sem mínimo, sem fatura recorrente. As suas primeiras 500 linhas são por nossa conta - depois paga conforme usa, à mesma tarifa fixa de qualquer outro scraper daqui.

Nível gratuito

500 linhas grátis - 0 $

Em cada conta nova, uma única vez. Sem cartão de crédito. O limite de registos e todos os formatos de exportação estão incluídos.

0 $ para sempre
Conforme usa

0,002 $ por linha após o nível gratuito

Cerca de 2 $ por cada 1.000 registos, com as colunas de enriquecimento incluídas em vez de faturadas como passo à parte. O estimador mostra o número de linhas e o custo em créditos antes de uma execução arrancar.

O mais escolhido
Volume

À medida · grande volume

Preços por volume, workers dedicados e um SLA para monitorização contínua ou extrações históricas muito grandes. Diga-nos os seus números e preparamos uma proposta.

Fale connosco
10 % de desconto na sua primeira execução paga.Use o código LIVESCRAPER10 no pagamento.
Registar
Combina bem com

Um diretório,
e os do lado.

A parte legal

É legal fazer scraping
das Yellow Pages?

Resposta curta: sim para o conteúdo dos registos - mas esta exportação traz dados de contacto e um veredicto de entregabilidade, e é essa a parte que merece a sua atenção.

Um registo das Yellow Pages existe para ser encontrado. O nome, o telefone, a morada, as categorias, os horários e a classificação são mostrados a qualquer pessoa que faça a pesquisa, com sessão iniciada ou não, e recolher informação de negócios publicamente listada para estudo de mercado é uma prática estabelecida há muito. Nada aqui toca num início de sessão, numa conta ou numa barreira de pagamento.

O enriquecimento é onde é devido cuidado. Esta exportação não para no diretório: acrescenta endereços de e-mail, as pessoas a eles associadas, telefones adicionais com o tipo de linha e perfis sociais. Um endereço de empresa num domínio de empresa é um contacto profissional na maioria das leituras - mas o endereço de um indivíduo identificado é dado pessoal na UE e no Reino Unido independentemente de onde tenha sido publicado, e emails_persons existe precisamente para nomear indivíduos. Se está a fazer prospeção, o fundamento legal e a oposição são consigo, e o veredicto de entregabilidade em emails_status diz-lhe se uma mensagem chega, não se lhe é permitido enviá-la. As duas coisas não têm relação e vale a pena mantê-las separadas também na sua cabeça.

Se a sua pergunta é sobre a estrutura do mercado e não sobre contacto - quantos, há quanto tempo, com que reputação -, descarte as colunas de e-mail, telefone e pessoas na importação e a maior parte disto deixa de se lhe aplicar. Não corremos rastreadores de terceiros na camada de dados, e as suas exportações apagam-se sozinhas ao fim de 30 dias. Os termos das Yellow Pages restringem o acesso automatizado, por isso reveja-os antes de escalar.

livescraper.app · princípios
Apenas registos públicos de negócios
Sem inícios de sessão, sem tocar em contas
E-mails e pessoas enriquecidos são dados pessoais
Entregável não é o mesmo que permitido
As exportações apagam-se sozinhas (30 dias)
Reveja os termos das próprias Yellow Pages antes de escalar.
Perguntas frequentes

O que as pessoas perguntam
antes de se registarem.

As perguntas que mais ouvimos. Mais alguma? Fale connosco - as respostas são escritas por pessoas, não por bots.

Como faço scraping das Yellow Pages?+
Com o Yellow Pages Search Scraper:
  1. Inicie sessão na plataforma.
  2. Abra o Yellow Pages Search Scraper.
  3. Escolha a região.
  4. Escreva o termo de pesquisa e a localidade.
  5. Defina um limite de registos, ou deixe-o vazio para levar tudo o que houver.
  6. Clique em Start scraping.
Porque é que o meu carregador põe os dados errados numa coluna?+
Porque está a ler por posição. Todas as execuções trazem os mesmos sessenta e três nomes de coluna, mas a ordem não é fixa entre execuções - numa das nossas a coluna hours chegou em penúltimo lugar em vez de vigésimo, e tudo o que vinha a seguir deslocou-se uma posição. Nada foi renomeado nem deixado de fora, por isso um carregador posicional mapeia mal em silêncio e reporta sucesso. Mapeie a linha de cabeçalho por nome em cada importação e o problema desaparece.
O que vem de cada registo?+
Sessenta e três colunas. Os campos de diretório são o nome, o telefone, a rua, a cidade, o estado, o código postal, as categorias, a classificação e o número de avaliações, os horários, o escalão de preços, um excerto de descrição, uma imagem e um link para o registo. O resto é enriquecimento: e-mails com veredicto de entregabilidade, as pessoas a eles associadas, telefones adicionais com tipo de linha, perfis sociais e detalhes lidos do próprio site do negócio, incluindo com que foi construído. Todos estão no CSV e no XLSX tal como no JSON.
O open_status é fiável?+
É exato para o momento em que essa linha foi capturada, que não é o mesmo em que a execução terminou. A coluna scraped_at varia dentro de um único ficheiro porque as linhas não foram todas lidas no mesmo instante, por isso open now e closed now são factos por linha. Leia open_status contra o scraped_at próprio dessa linha e, se precisar dos horários como propriedade do negócio e não como instantâneo, use a coluna hours.
Em que formato vêm os e-mails e os seus estados?+
Os endereços chegam em emails como array e estão também achatados em email_1, email_2 e email_3. A escada é consistente - nenhuma linha tem um segundo endereço sem um primeiro, nem um terceiro sem um segundo. Cada entrada em emails_status tem duas partes unidas por vírgula: um veredicto de entregabilidade e depois um detalhe. O detalhe não é um vocabulário fixo e pode nomear o tipo de caixa de correio ou repetir um domínio, por isso decida pela parte antes da vírgula e trate o resto como texto livre.
Posso dividir contact_name em nome próprio e apelido?+
Não com segurança. Os valores são tantas vezes o nome de um consultório ou de uma empresa como o de um indivíduo, por isso dividir por espaços produzirá disparates numa boa parte de qualquer lista. Se precisar de campos ao nível da pessoa, leia emails_persons e trate contact_name como uma etiqueta e não como um nome.
Que regiões cobre?+
Há um seletor de região no formulário, e ele marca qualquer entrada que o analisador ainda não trate - essas mostram um aviso de que o site usa uma disposição diferente. A lista é carregada quando a página abre, em vez de estar fixada de antemão, por isso consulte o menu para ver o que tem disponível em vez de tirar uma lista desta página. A predefinição é o site dos EUA.
Quanto custa?+
As primeiras 500 linhas são grátis e de uma só vez, sem cartão de crédito. Depois disso são 0,002 $ por linha - cerca de 2 $ por cada 1.000 registos - que é a mesma tarifa fixa de qualquer outro scraper da plataforma, com as colunas de enriquecimento incluídas em vez de cobradas como passo à parte. O estimador mostra o custo de uma execução antes de ela arrancar.

Os seus primeiros 500 registos,
são por nossa conta.

500 linhas grátis de uma só vez em cada conta nova - sem data de validade. Depois 0,002 $ por linha, conforme usa - sem cartão guardado até que o diga.

Ativo de imediato · sem cartão

Fazer scraping de registos das Yellow Pages em escala

O Yellow Pages Search Scraper da Livescraper transforma uma categoria e uma localidade numa tabela de leads. Escolhe uma região, escreve o que procura e onde, limita se quiser o número de registos, e descarrega os resultados como um CSV, um Excel ou um JSON limpos. Volta uma linha por registo, e as suas duas entradas viajam em cada linha como um único valor query, por isso um ficheiro que misture várias pesquisas continua separável.

Cada linha traz sessenta e três colunas. O lado do diretório é o nome do negócio, o telefone, a rua, a cidade, o estado e o código postal, as categorias tanto como array como em cadeia unida, a classificação e o número de avaliações, os horários numa forma compacta e legível por máquina, um excerto de descrição, uma imagem e um link de volta ao registo. O lado do enriquecimento acrescenta endereços de e-mail com veredicto de entregabilidade, as pessoas a eles associadas, mais telefones com o seu tipo de linha, perfis sociais e detalhes lidos do próprio site do negócio - o seu título, descrição, keywords, com que foi construído e se traz um pixel do Facebook ou uma etiqueta do Google.

As equipas de vendas usam-no para construir uma lista contactável numa só passagem, filtrando pelo veredicto de entregabilidade antes de algo chegar a uma ferramenta de envio. Quem investiga põe classificação, número de avaliações e anos de atividade lado a lado para distinguir um mercado local cheio de um magro. As equipas de go-to-market filtram pelas colunas do site para encontrar negócios que usam uma plataforma específica.

Uma propriedade desta exportação merece atenção antes de construir sobre ela: a ordem das colunas não é estável entre execuções. Todas trazem os mesmos sessenta e três nomes, mas numa das nossas a coluna hours chegou em penúltimo lugar em vez de vigésimo e as colunas seguintes deslocaram-se uma posição. Nada foi renomeado nem deixado de fora, e é exatamente por isso que um carregador que lê por posição mapeia mal em silêncio e reporta sucesso - mapeie a linha de cabeçalho por nome em cada importação. Vale também a pena saber que scraped_at varia dentro de um único ficheiro, por isso o campo open_status descreve o momento próprio de cada linha e não a execução no seu conjunto. Comece grátis: as suas primeiras 500 linhas não custam nada e não exigem cartão de crédito, e depois é uma tarifa fixa de 0,002 $ por linha.