Extractor de Búsqueda de Yellow Pages

Una categoría y una ciudad,
como tabla de leads.

Escribe qué buscas y dónde, y recibe las fichas como filas: el nombre, el teléfono, la calle, las categorías, la valoración y el número de reseñas, los horarios, el sitio web y, donde el enriquecimiento resuelve, correos de contacto con un veredicto de entregabilidad, perfiles sociales y detalles leídos del propio sitio. Sesenta y tres columnas, una fila por ficha.

500 filas gratis, una sola vezdespués 0,002 $ por fila63 columnasCSV · XLSX · JSON
Cómo funciona

Dos cajas de entrada,
una tabla de leads de salida.

La entrada son las mismas dos cosas que escribirías en el propio sitio: qué quieres y dónde lo quieres.

  1. PASO 1Inicia sesión en la plataforma.
  2. PASO 2Abre el Yellow Pages Search Scraper.
  3. PASO 3Elige la región.
  4. PASO 4Escribe el término de búsqueda y la ubicación.
  5. PASO 5Fija un límite de registros, o déjalo vacío para llevarte todo lo disponible.
  6. PASO 6Haz clic en Start scraping.

Los dos campos acaban en cada fila, unidos como un único valor query con la forma search, location, así que un archivo que mezcla varias búsquedas sigue siendo separable después.

Por qué lo usan los equipos

Una ficha de directorio,
ya enriquecida.

La ficha, y luego todo lo demás

Los campos del directorio son solo el primer tercio de la fila. El resto es enriquecimiento: correos con veredicto de entregabilidad, perfiles sociales y detalles leídos del propio sitio web del negocio.

Correos que vienen con un veredicto

Las direcciones llegan acompañadas de un estado en lugar de solas, así que una lista se puede filtrar hasta lo que merece la pena enviar antes de que nadie la cargue en una herramienta de envío.

Horarios en forma legible por máquina

Los horarios llegan como Mo-Fr 09:00-18:00, Sa 09:00-15:00 y no como prosa: una forma que puedes analizar en lugar de una frase que tienes que interpretar.

Lo que recibes

Sesenta y tres columnas -
y una cosa que arreglar primero.

Esta exportación tiene datos reales, así que esta página puede ser concreta sobre formatos. También tiene una propiedad que corromperá un pipeline en silencio, y merece dos párrafos antes de la tabla.

El orden de las columnas no es estable entre ejecuciones. Todas las ejecuciones que tenemos llevan los mismos sesenta y tres nombres, pero no siempre llegan en la misma secuencia: en una de ellas hours apareció en penúltimo lugar en vez de en el vigésimo, y las columnas posteriores se desplazaron una posición. No se añadió, quitó ni renombró nada; solo se movió el orden.

Eso es inofensivo si lees por nombre de columna y destructivo si lees por posición. Un cargador que toma la columna 20 como amenities porque la semana pasada era amenities llenará ese campo con horarios de apertura y nunca lanzará un error. Mapea la fila de cabecera por nombre en cada importación y, si tu herramienta lo pone difícil, esta es la única cosa que conviene arreglar antes de la primera ejecución real y no después.

Diccionario de datos

Sesenta y tres columnas,
leídas por nombre.

Tomadas de la fila de cabecera y de las claves JSON de ejecuciones reales, que coinciden. Los formatos de abajo están medidos sobre celdas con datos: donde una columna tiene una forma fija, se indica; donde no la tiene, no se inventa.

name
El nombre del negocio tal como lo muestra la ficha.
phone
El teléfono principal, siempre con la forma (212) 473-4444: paréntesis, un espacio y luego un guion.
category
Las categorías como una sola cadena. Es exactamente categories unido con coma y espacio, así que las dos son el mismo dato dos veces: quédate con la que te convenga e ignora la otra.
categories
Las mismas categorías como array, que es la forma por la que filtrar.
area
La línea de calle de la dirección. Ciudad, estado y código postal tienen sus propias columnas al lado.
city
La ciudad.
state
El estado, siempre dos letras mayúsculas.
pincode
El código postal, siempre cinco dígitos.
range
El indicador de rango de precios que la ficha puede llevar.
rating
La valoración media, como número dentro de una cadena. Ella y reviews_count llegan siempre juntas: una ficha tiene las dos o ninguna.
reviews_count
Sobre cuántas reseñas se construye esa media.
open_status
Si el negocio estaba abierto en el momento en que se capturó esa fila: open now, closed now, opening soon, open 24 hours. Léelo contra el scraped_at de esa fila, no contra la ejecución; mira la nota de abajo.
email
El campo de correo único. La salida del enriquecimiento aterriza en email_1 a email_3 y en emails, que son las columnas que hay que leer para direcciones de contacto.
website
El sitio propio del negocio. Todas las columnas derivadas del sitio que hay debajo quedan vacías salvo que esta esté rellena, aunque una web rellena no garantiza que se resolvieran.
directions
Un enlace a la página de indicaciones de la ficha.
image
Un enlace a la imagen en miniatura de la ficha.
years_in_business
Cuánto tiempo dice la ficha que lleva operando el negocio, como número entero.
description
Un fragmento corto, truncado. Trátalo como una vista previa y no como un texto de presentación: algunos valores son la propia descripción del negocio y otros son una reseña de cliente, y por eso alguno puede acabar a media frase o en una comilla suelta.
source_url
La página de la ficha de la que se leyó la fila. La columna que hay que conservar por si alguna vez necesitas comprobar un valor a mano.
hours
Horarios en la forma compacta Mo-Fr 09:00-18:00, Sa 09:00-15:00: códigos de día de dos letras, rangos unidos por comas.
amenities
Atributos que la ficha anuncia. Dos atributos pueden llegar en un mismo valor separados por un salto de línea, así que divide por saltos de línea en lugar de asumir una sola etiqueta.
facebook
Enlace a la página de Facebook del negocio.
instagram
Enlace al perfil de Instagram del negocio.
linkedin
Enlace a la página de LinkedIn del negocio.
tiktok
Enlace al perfil de TikTok del negocio.
medium
Enlace a la publicación de Medium del negocio.
reddit
Enlace a la presencia del negocio en Reddit.
skype
El usuario de Skype del negocio.
snapchat
Enlace al perfil de Snapchat del negocio.
telegram
Enlace a la presencia del negocio en Telegram.
whatsapp
El contacto de WhatsApp del negocio.
twitter
Enlace al perfil de X/Twitter del negocio.
vimeo
Enlace al canal de Vimeo del negocio.
youtube
Enlace a la presencia del negocio en YouTube: un canal, una página de usuario o un solo vídeo, así que no asumas que será una URL de canal.
github
Enlace a la organización de GitHub del negocio.
crunchbase
Enlace al perfil de Crunchbase del negocio.
emails
Todas las direcciones que encontró el enriquecimiento, como array.
emails_status
Una entrada por dirección de emails, cada una con dos partes unidas por coma: un veredicto de entregabilidad y luego un detalle. El detalle no es un vocabulario fijo -puede nombrar el tipo de buzón o repetir un dominio-, así que decide según la parte anterior a la coma y trata el resto como texto libre.
website_title
El <title> del sitio del negocio.
website_description
La meta descripción del sitio del negocio.
website_keywords
Las meta keywords del sitio del negocio.
website_generator
Con qué se construyó el sitio, leído de su etiqueta generator: un CMS, un maquetador o un plugin de SEO, y a menudo con una cadena de versión.
website_has_fb_pixel
Si se encontró un píxel de Facebook en el sitio. Un booleano de verdad, no una cadena.
website_has_google_tag
Si se encontró una etiqueta de Google en el sitio. También un booleano de verdad.
phones_extra
Más teléfonos encontrados para el negocio, como array. Puede repetir el número que ya está en phone, así que deduplica contra esa columna antes de marcar nada.
phones_extra_types
El tipo de línea de cada entrada de phones_extra, alineado por posición y siempre de la misma longitud, pero una entrada puede ser null cuando no se pudo determinar el tipo, así que indexa con cuidado.
phone_type
El tipo de línea del teléfono principal phone.
contact_name
Un nombre de contacto del enriquecimiento. No des por hecho que es una persona: los valores son tan a menudo el nombre de una consulta o una empresa como el de un individuo, así que no es seguro partirlo en nombre y apellido.
contact_title
El cargo que acompaña a contact_name.
is_public
Si la empresa cotiza en bolsa. Un booleano de verdad.
wp_name
El nombre de la empresa tal como lo tiene el proveedor de datos telefónicos.
wp_address
La dirección tal como la tiene el proveedor de datos telefónicos.
phones_extra_wp
Más teléfonos del proveedor de datos telefónicos.
emails_persons
Las personas que el enriquecimiento asoció a las direcciones encontradas, como array.
employees
La plantilla de la empresa, como número.
scraped_at
Cuándo se capturó esa fila, como 2026-07-06 09:16:41.954000. Esto varía dentro de una misma ejecución: las filas de un archivo no se leyeron todas en el mismo instante, y eso es lo que convierte open_status en un dato por fila.
query
Tus dos entradas unidas como search, location, repetidas en cada fila que salió de ellas.
position
El puesto de la ficha en el orden de resultados, empezando en 1 y único dentro de una ejecución. La columna por la que ordenar para reconstruir el ranking exactamente como se devolvió.
email_1
La primera dirección de correo enriquecida. Ninguna fila lleva email_2 sin esta.
email_2
La segunda dirección de correo enriquecida, cuando la hay.
email_3
La tercera dirección de correo enriquecida, cuando la hay.
industry
El sector que asigna el enriquecimiento a nivel de empresa.
founded_year
El año de fundación de la empresa, como número.

Lee esta exportación por nombre de columna, nunca por posición. Todas las ejecuciones llevan los mismos sesenta y tres nombres, pero el orden no es fijo: en una de las nuestras hours llegó en penúltimo lugar en vez de en el vigésimo, y todo lo posterior se desplazó una posición. No se renombró ni se eliminó nada; un cargador posicional simplemente habría escrito horarios de apertura en el campo de atributos y habría informado de éxito. Lo segundo que hay que saber es que scraped_at varía dentro de un mismo archivo, porque las filas no se capturaron todas en el mismo instante, así que open_status describe el momento propio de cada fila y no es una propiedad de la ejecución. Y tres formas menores que conviene manejar antes de que sorprendan: category es solo categories unido por comas, o sea el mismo dato dos veces; amenities puede meter dos valores en una cadena separados por un salto de línea; y phones_extra_types encaja con phones_extra índice a índice pero puede contener un null donde no se determinó el tipo.

Controles de ejecución

Se ajusta en el trabajo,
no en la hoja de cálculo.

Cuatro controles, y son toda la entrada: dónde buscar, qué buscar, en qué sitio y cuánto llevarse. Los botones de orden y filtro junto a los resultados son controles de vista: dan forma a lo que estás mirando, no a lo que trae la ejecución.

Región Término de búsqueda Ubicación Límite (registros) Límite vacío se lo lleva todo Una fila por ficha Exportación CSV Exportación XLSX Exportación JSON
Flujos de trabajo habituales

Tres tareas que se ejecutan
aquí más que ninguna otra.

Algunos ejemplos de cómo los equipos usan fichas de directorio para responder a una pregunta que de verdad tienen.

Generación de leads

Construir una lista contactable de una pasada

Una categoría y una ciudad producen las fichas; las columnas de enriquecimiento producen la forma de llegar a ellas. Como cada dirección llega con un veredicto de entregabilidad, la lista se puede filtrar antes de que llegue a una herramienta de envío en vez de después de que vuelvan los rebotes.

Generación de leads · Ventas
Mapa de mercado

Dimensionar un gremio local y ver quién está asentado

Valoración, número de reseñas y años de actividad están en la misma fila, y eso basta para distinguir un mercado saturado de uno escaso y un recién llegado de un clásico, sin abrir una sola ficha a mano.

Investigación
Stack técnico

Encontrar negocios con una configuración concreta

Las columnas de sitio web dicen con qué se construyó cada uno y si lleva un píxel de Facebook o una etiqueta de Google. Para quien vende a los usuarios de una plataforma, eso convierte un directorio en una lista cualificada.

Go-to-market
Precios

Paga solo por las fichas
que realmente extraes.

Sin suscripción, sin mínimo, sin factura recurrente. Tus primeras 500 filas corren de nuestra cuenta; después pagas por uso, a la misma tarifa plana que cualquier otro scraper de aquí.

Nivel gratuito

500 filas gratis - 0 $

En cada cuenta nueva, una sola vez. Sin tarjeta de crédito. El límite de registros y todos los formatos de exportación están incluidos.

0 $ para siempre
Pago por uso

0,002 $ por fila tras el nivel gratuito

Unos 2 $ por cada 1.000 fichas, con las columnas de enriquecimiento incluidas en lugar de facturadas como un paso aparte. El estimador muestra el número de filas y el coste en créditos antes de que arranque una ejecución.

El más elegido
Volumen

A medida · gran volumen

Precios por volumen, workers dedicados y un SLA para monitorización continua o descargas históricas muy grandes. Dinos tus cifras y preparamos un presupuesto.

Habla con nosotros
10 % de descuento en tu primera ejecución de pago.Usa el código LIVESCRAPER10 al pagar.
Registrarse
Combina bien con

Un directorio,
y los de al lado.

La parte legal

¿Es legal hacer scraping
de Yellow Pages?

Respuesta corta: sí para el contenido de las fichas, pero esta exportación lleva datos de contacto y un veredicto de entregabilidad, y esa es la parte que merece tu atención.

Una ficha de Yellow Pages existe para ser encontrada. El nombre, el teléfono, la dirección, las categorías, los horarios y la valoración se muestran a cualquiera que ejecute la búsqueda, con sesión o sin ella, y recopilar información de negocios listada públicamente para investigación de mercado es una práctica asentada desde hace tiempo. Nada de esto toca un inicio de sesión, una cuenta o un muro de pago.

El enriquecimiento es donde hay que poner cuidado. Esta exportación no se detiene en el directorio: añade direcciones de correo, las personas asociadas a ellas, teléfonos adicionales con su tipo de línea y perfiles sociales. Una dirección de empresa en un dominio corporativo es un contacto de empresa en la mayoría de lecturas, pero la dirección de una persona identificada es dato personal en la UE y el Reino Unido con independencia de dónde se publicara, y emails_persons existe precisamente para nombrar individuos. Si haces prospección, la base legal y la baja son cosa tuya, y el veredicto de entregabilidad de emails_status te dice si un mensaje llegará, no si tienes permiso para enviarlo. Son cosas distintas y conviene mantenerlas separadas también en tu cabeza.

Si tu pregunta va de estructura de mercado y no de contacto -cuántos, cuán asentados, cuán bien valorados-, descarta las columnas de correo, teléfono y personas al importar y casi todo esto deja de aplicarte. No ejecutamos rastreadores de terceros en la capa de datos y tus exportaciones se borran solas a los 30 días. Los términos de Yellow Pages restringen el acceso automatizado, así que revísalos antes de escalar.

livescraper.app · principios
Solo fichas públicas de negocios
Sin inicios de sesión, sin tocar cuentas
Los correos y personas enriquecidos son datos personales
Entregable no es lo mismo que permitido
Las exportaciones se borran solas (30 días)
Revisa los términos propios de Yellow Pages antes de escalar.
Preguntas frecuentes

Lo que pregunta la gente
antes de registrarse.

Las preguntas que más nos hacen. ¿Alguna más? Habla con nosotros: las respuestas las escriben personas, no bots.

¿Cómo hago scraping de Yellow Pages?+
Con el Yellow Pages Search Scraper:
  1. Inicia sesión en la plataforma.
  2. Abre el Yellow Pages Search Scraper.
  3. Elige la región.
  4. Escribe el término de búsqueda y la ubicación.
  5. Fija un límite de registros, o déjalo vacío para llevarte todo lo disponible.
  6. Haz clic en Start scraping.
¿Por qué mi cargador pone los datos equivocados en una columna?+
Porque lee por posición. Todas las ejecuciones llevan los mismos sesenta y tres nombres de columna, pero el orden no es fijo entre ejecuciones: en una de las nuestras la columna hours llegó en penúltimo lugar en vez de en el vigésimo, y todo lo posterior se desplazó una posición. No se renombró ni se eliminó nada, así que un cargador posicional mapea mal en silencio e informa de éxito. Mapea la fila de cabecera por nombre en cada importación y el problema desaparece.
¿Qué se recibe de cada ficha?+
Sesenta y tres columnas. Los campos de directorio son el nombre, el teléfono, la calle, la ciudad, el estado, el código postal, las categorías, la valoración y el número de reseñas, los horarios, el rango de precios, un fragmento de descripción, una imagen y un enlace a la ficha. El resto es enriquecimiento: correos con veredicto de entregabilidad, las personas asociadas a ellos, teléfonos adicionales con tipo de línea, perfiles sociales y detalles leídos del propio sitio web del negocio, incluido con qué se construyó. Todos están en el CSV y el XLSX igual que en el JSON.
¿Es fiable open_status?+
Es exacto para el momento en que se capturó esa fila, que no es el mismo en que terminó la ejecución. La columna scraped_at varía dentro de un mismo archivo porque las filas no se leyeron todas en el mismo instante, así que open now y closed now son datos por fila. Lee open_status contra el scraped_at propio de esa fila y, si necesitas los horarios como propiedad del negocio y no como una instantánea, usa la columna hours.
¿En qué formato vienen los correos y sus estados?+
Las direcciones llegan en emails como array y también aplanadas en email_1, email_2 y email_3. La escalera es consistente: ninguna fila tiene una segunda dirección sin una primera, ni una tercera sin una segunda. Cada entrada de emails_status tiene dos partes unidas por coma: un veredicto de entregabilidad y luego un detalle. El detalle no es un vocabulario fijo y puede nombrar el tipo de buzón o repetir un dominio, así que decide según la parte anterior a la coma y trata el resto como texto libre.
¿Puedo partir contact_name en nombre y apellido?+
No con seguridad. Los valores son tan a menudo el nombre de una consulta o una empresa como el de un individuo, así que partir por espacios producirá disparates en buena parte de cualquier lista. Si necesitas campos a nivel de persona, lee emails_persons y trata contact_name como una etiqueta y no como un nombre.
¿Qué regiones cubre?+
Hay un selector de región en el formulario, y marca cualquier entrada que el analizador aún no maneje: esas muestran un aviso de que el sitio usa una maquetación distinta. La lista se carga al abrir la página en lugar de estar fijada de antemano, así que consulta el desplegable para ver qué tienes disponible en vez de tomar una lista de esta página. El valor por defecto es el sitio de EE. UU.
¿Cuánto cuesta?+
Las primeras 500 filas son gratis y de una sola vez, sin tarjeta de crédito. Después son 0,002 $ por fila -unos 2 $ por cada 1.000 fichas-, la misma tarifa plana que cualquier otro scraper de la plataforma, con las columnas de enriquecimiento incluidas en lugar de cobradas como un paso aparte. El estimador muestra el coste de una ejecución antes de que arranque.

Tus primeras 500 fichas,
invita la casa.

500 filas gratis de una sola vez en cada cuenta nueva, sin fecha de caducidad. Después, 0,002 $ por fila y pago por uso: sin tarjeta guardada hasta que tú lo digas.

Activo al instante · sin tarjeta

Hacer scraping de fichas de Yellow Pages a escala

El Yellow Pages Search Scraper de Livescraper convierte una categoría y una ubicación en una tabla de leads. Eliges una región, escribes qué buscas y dónde, limitas si quieres el número de registros y descargas los resultados como un CSV, un Excel o un JSON limpios. Vuelve una fila por ficha, y tus dos entradas viajan en cada fila como un único valor query, de modo que un archivo que mezcla varias búsquedas sigue siendo separable.

Cada fila lleva sesenta y tres columnas. El lado del directorio es el nombre del negocio, el teléfono, la calle, la ciudad, el estado y el código postal, las categorías tanto como array como en cadena unida, la valoración y el número de reseñas, los horarios en forma compacta y legible por máquina, un fragmento de descripción, una imagen y un enlace de vuelta a la ficha. El lado del enriquecimiento añade direcciones de correo con veredicto de entregabilidad, las personas asociadas a ellas, más teléfonos con su tipo de línea, perfiles sociales y detalles leídos del propio sitio del negocio: su título, descripción, keywords, con qué se construyó y si lleva un píxel de Facebook o una etiqueta de Google.

Los equipos de ventas lo usan para construir una lista contactable de una sola pasada, filtrando por el veredicto de entregabilidad antes de que nada llegue a una herramienta de envío. Quienes investigan ponen valoración, número de reseñas y años de actividad uno al lado del otro para distinguir un mercado local saturado de uno escaso. Los equipos de go-to-market filtran por las columnas de sitio web para encontrar negocios que usan una plataforma concreta.

Una propiedad de esta exportación merece atención antes de construir sobre ella: el orden de las columnas no es estable entre ejecuciones. Todas llevan los mismos sesenta y tres nombres, pero en una de las nuestras la columna hours llegó en penúltimo lugar en vez de en el vigésimo y las columnas posteriores se desplazaron una posición. No se renombró ni se eliminó nada, y precisamente por eso un cargador que lee por posición mapea mal en silencio e informa de éxito: mapea la fila de cabecera por nombre en cada importación. También conviene saber que scraped_at varía dentro de un mismo archivo, así que el campo open_status describe el momento propio de cada fila y no la ejecución en conjunto. Empieza gratis: tus primeras 500 filas no cuestan nada y no requieren tarjeta de crédito, y después es una tarifa plana de 0,002 $ por fila.