Extractor de Búsqueda de Yahoo

Una página de resultados de Yahoo,
fila a fila.

Envía una consulta y recibe lo que Yahoo mostró, como una tabla: el puesto, el título, el enlace y el fragmento, una fila por resultado. Cinco columnas, y en las 360 filas que hay detrás de esta página todas ellas estaban llenas en todas las filas.

500 filas gratis por única vezdespués 0,002 $ por filacinco columnas por resultadoCSV · JSON · Excel
Cómo funciona

Una consulta entra, una tabla ordenada sale.

  1. PASO 1Inicia sesión en la plataforma.
  2. PASO 2Abre el Yahoo Search Scraper.
  3. PASO 3Escribe las consultas que quieras, una por línea.
  4. PASO 4Elige tu formato de salida (CSV / JSON / XLSX).
  5. PASO 5Lanza el trabajo.
  6. PASO 6Descarga los resultados: una fila por resultado, cinco columnas.
Cómo es la exportación en realidad

Cinco columnas y dos cosas que conviene saber.

Nunca hay nada en blanco

En las 360 filas que tenemos, query, position, title, url y description estaban rellenas en absolutamente todas las filas. Ni una sola celda vacía en toda la exportación. Es lo bastante inusual como para decirlo: la mayoría de las fuentes te obligan a escribir comprobaciones de nulos.

position es un número, y es correlativo

En las cinco ejecuciones position fue 1, 2, 3 … N sin huecos y sin repeticiones. Puedes ordenar por ella directamente, y un número que falte significa que se perdió una fila en tu proceso, no en el scraping.

La misma URL puede aparecer dos veces

Esta es la que pilla a la gente. Dentro de una misma ejecución la columna url se repite: 20 filas duplicadas en una exportación de 74 filas, y 4, 9, 11 y 16 en las demás. Son filas reales en posiciones reales, no un fallo de la exportación. Deduplica por url antes de contar nada.

Un conjunto de resultados no es estable de un día para otro

Ejecutamos python web scraping dos veces, con 24 horas de diferencia. 66 URLs distintas el primer día, 62 el segundo, y solo 42 en ambas: alrededor de un tercio se renovó. De las 42 que sobrevivieron, 22 ocupaban otra posición. Trata una ejecución como una instantánea, no como el ranking.

Los fragmentos son texto real, a veces recortado

Las descripciones fueron de 6 a 417 caracteres, con mediana de 194, y 79 de las 360 terminaron en puntos suspensivos: Yahoo las cortó. Prevé una columna de texto amplia y no interpretes unos «…» finales como un problema de datos.

Los títulos a veces llevan la URL visible

Nueve de los 360 títulos empezaban con un dominio de miga de pan separado por espacios, como www. python .org › downloads Download Python. Es una minoría, pero si comparas por título te sorprenderá. Elimina ese fragmento inicial o compara por url.

Lo que recibes

Cinco columnas, por resultado.

Leídas de la cabecera de una exportación real de este servicio, en el orden de la hoja. Cada descripción de abajo se apoya en las 360 filas que medimos.

query
El término que enviaste, repetido en cada fila para que una exportación con varias consultas siga siendo separable. Cada una de nuestras cinco ejecuciones llevaba exactamente una consulta; esta columna es lo que permite fusionarlas.
position
El puesto, como número. Correlativo desde 1, sin huecos ni repeticiones en las cinco ejecuciones: de 1 a 74, de 1 a 70, de 1 a 73, de 1 a 69 y de 1 a 74. Ordena por esto en lugar de por el orden de las filas.
title
El titular del resultado. Normalmente el título de la página; en 9 de nuestras 360 filas empezaba con un dominio visible separado por espacios como www. python .org › downloads antes del título real.
url
El enlace de destino. 358 de 360 eran https y 2 eran http, repartidos en 168 hosts distintos. Esta columna se repite dentro de una ejecución: deduplica por ella.
description
El fragmento bajo el resultado. De 6 a 417 caracteres, mediana 194, con 79 de 360 terminando en puntos suspensivos donde Yahoo lo recortó.

Cinco columnas por fila · CSV, JSON o Excel

Medido sobre 5 ejecuciones reales y 360 filas: python (74 filas), snake (69), titan (74) y python web scraping dos veces (70 y 73). El número de filas por consulta varió entre 69 y 74, así que no hay un tamaño de página fijo en el que apoyarse: lee las filas que recibes en vez de suponer una cifra redonda.

Flujos de trabajo habituales

Para qué sirve un segundo buscador.

Seguimiento de posiciones

Vigilar una posición en el tiempo, no una sola vez

Lanza las mismas consultas de forma programada y guarda query, url, position y la fecha de ejecución. Nuestras propias dos ejecuciones con un día de diferencia movieron 22 de 42 URLs compartidas: una sola lectura dice muy poco y una serie dice mucho.

SEO · Reporting
Visibilidad competitiva

Ver quién más posiciona por tus términos

Agrupa por host y cuenta. Nuestras 360 filas abarcaron 168 hosts distintos, y esa es exactamente la pregunta: quién aparece una y otra vez en las consultas que te importan, y a qué profundidad.

SEO · Investigación de mercado
Comprobación de cobertura

Comparar Yahoo con Google

Pasa la misma lista de consultas por este servicio y por el Google Search Scraper, y luego compara los conjuntos de URLs. Donde ambos discrepan suele haber algo que una auditoría encuentra.

SEO · Auditoría
Captación de leads

Convertir una página de resultados en una lista

Una consulta de categoría más ciudad devuelve páginas de proveedores por docenas. Lleva la columna url al Email & Contact Scraper y la SERP se convierte en una lista contactable.

Ventas · Prospección
Precios

Paga solo por lo que realmente usas.

Plan gratuito

Las primeras 500 filas son gratis

Por única vez, al registrarte. Sin tarjeta y sin nada que cancelar después.

Por única vez, al registrarte
Tarifa

después 0,002 $ por fila

Se factura por filas realmente devueltas. Con las 69 a 74 filas que devolvió una consulta en nuestras ejecuciones, 500 filas gratis son unas siete consultas antes de que se cobre nada.

Facturado por filas devueltas
Sin suscripción

Nada recurrente

Los créditos no caducan en un ciclo mensual. Lanza un lote ahora y nada más hasta que lo necesites.

Sin caducidad mensual
10 % de descuento en tu primera ejecución de pago.Usa el código LIVESCRAPER10 al pagar.
Registrarse
Combina bien con

El resto de la familia de búsqueda.

La parte legal

¿Es legal hacer scraping de resultados de Yahoo?

Una página de resultados es una página pública, y las cinco columnas de aquí describen páginas web, no personas. Las advertencias son sobre volumen y reutilización.

Leer una página de resultados es lo que hace cualquier visitante, y un puesto, un título, un enlace y un fragmento son hechos sobre páginas web de acceso público. Nada en la exportación identifica a una persona: no hay nombre, ni correo, ni teléfono, ni cuenta, así que las cuestiones de protección de datos que marcan nuestros servicios sobre personas no se plantean aquí.

Conviene decir dos cosas con claridad. Primero, los fragmentos y los títulos los escriben los sitios indexados, no nosotros, y son su texto protegido por derechos de autor. Usarlos internamente para seguimiento de posiciones, análisis competitivo y auditorías es práctica habitual; publicarlos como contenido propio es otra pregunta con otra respuesta. Segundo, esto es una instantánea y no un ranking: nuestras dos ejecuciones de la misma consulta con un día de diferencia compartieron solo 42 de unas 64 URLs, así que cualquier conclusión sacada de una sola exportación es más débil de lo que parece. Lanza una serie.

Nuestras condiciones son las mismas que en cualquier otro servicio de aquí. Solo páginas de acceso público, nada detrás de un inicio de sesión, sin rastreadores de terceros en la capa de datos, y las exportaciones se eliminan automáticamente a los 30 días. Tus primeras 500 filas son gratis y no necesitan tarjeta.

livescraper.app · qué condiciona una ejecución
Una consulta por conjunto de filas
El número de filas varió entre 69 y 74 en nuestras ejecuciones
position es correlativa desde 1
url se repite: deduplica antes de contar!
Las exportaciones se eliminan a los 30 días
Los resultados cambian de un día para otro. En la única consulta que lanzamos dos veces, un tercio de las URLs se renovó en 24 horas.
Preguntas frecuentes

Lo que la gente pregunta antes de registrarse.

¿Qué columnas contendrá la exportación?+
Cinco: query, position, title, url y description. Una fila por resultado. En las 360 filas que hay detrás de esta página, cada una de esas cinco estaba llena en todas las filas: no hubo ni una sola celda vacía.
¿Cuántos resultados devuelve una consulta?+
Varía. Nuestras cinco ejecuciones devolvieron 74, 70, 73, 69 y 74 filas, así que no hay un tamaño de página fijo con el que planificar. Lee las filas que recibes en vez de suponer una cifra redonda.
¿Por qué aparece la misma URL más de una vez?+
Porque Yahoo la muestra más de una vez. Dentro de una sola ejecución contamos 20 filas duplicadas en una exportación de 74 filas, y 4, 9, 11 y 16 en las demás. Están en posiciones reales y distintas. Deduplica por url antes de contar hosts o medir cuota de resultados.
¿Los resultados son los mismos si lanzo la consulta mañana?+
No. Ejecutamos python web scraping dos veces, con 24 horas de diferencia: 66 URLs distintas el primer día, 62 el segundo, 42 presentes en ambas. De esas 42, 22 habían cambiado de posición. Incluso el top diez compartía 9 de 10 URLs, pero no en el mismo orden. Trata una ejecución como una instantánea y sigue una serie si necesitas una tendencia.
¿Puedo ordenar por la columna position?+
Sí. Es un número y en las cinco ejecuciones fue correlativo de 1 a N, sin huecos ni repeticiones. Un número que falte en tus datos significa, por tanto, que se perdió una fila en tu proceso, no en el scraping.
¿Por qué algunos títulos empiezan por algo como «www. python .org»?+
Yahoo antepone a veces la URL visible como miga de pan. Ocurrió en 9 de nuestras 360 filas. Si comparas por título, elimina ese fragmento inicial, o compara por url, que no tiene ese problema.
¿Cuánto cuesta?+
Tus primeras 500 filas son gratis, por única vez y sin tarjeta. Después son 0,002 $ por fila, facturadas por filas realmente devueltas. Con las 69 a 74 filas que devolvió una consulta en nuestras ejecuciones, el plan gratuito cubre unas siete consultas.
¿En qué formatos puedo exportar?+
CSV, JSON o Excel. Las cinco columnas y su orden son los mismos en los tres.

Pon una página de resultados en una hoja de cálculo.

Cinco columnas por resultado, llenas en todas las filas. Tus primeras 500 filas son gratis, después 0,002 $ cada una.

Se activa al instante · sin tarjeta

Hacer scraping de resultados de Yahoo

El Yahoo Search Scraper toma una consulta y devuelve la página de resultados como filas: query, position, title, url y description, una fila por resultado. Detrás de esta página hay cinco ejecuciones y 360 filas, y cada una de esas cinco columnas estaba rellena en cada una de esas filas: ninguna celda vacía en toda la exportación. position vuelve como un número correlativo desde 1, así que ordena directamente y un hueco en tus datos significa que se perdió una fila más adelante, no durante el scraping.

Dos propiedades de los datos importan más que el esquema. La primera es la duplicación: dentro de una sola ejecución la columna url se repite, 20 veces en una exportación de 74 filas y 4, 9, 11 y 16 veces en las demás. Son filas auténticas en posiciones auténticas, así que cualquier recuento de hosts, dominios o cuota de resultados tiene que deduplicar primero. La segunda es la volatilidad. Ejecutamos la consulta python web scraping dos días seguidos: 66 URLs distintas el primer día, 62 el segundo, y solo 42 aparecieron en ambas. De esas 42 supervivientes, 22 habían cambiado de posición, e incluso el top diez compartía nueve de diez URLs en otro orden. Una sola exportación es la instantánea de un momento, y un programa de seguimiento de posiciones basado en una lectura por trimestre informará de ruido como si fuera movimiento.

Los recuentos de filas tampoco son fijos: nuestras cinco ejecuciones devolvieron 74, 70, 73, 69 y 74 filas, con una consulta cada una. Los fragmentos fueron de 6 a 417 caracteres con una mediana de 194, y 79 de los 360 terminaron en puntos suspensivos donde Yahoo los recortó, así que la columna description pide un tipo de texto amplio y no un varchar corto. Los títulos suelen ser el título de la página, pero en 9 de las 360 filas empezaban con un dominio visible separado por espacios como www. python .org › downloads; comparar por url lo evita por completo. En las 360 filas hubo 168 hosts distintos, 358 enlaces https y 2 http.

Los usos habituales se derivan de esa forma. El seguimiento de posiciones funciona si lanzas una serie en lugar de una exportación única. La visibilidad competitiva es una agrupación por host. Auditar la cobertura significa pasar la misma lista de consultas por este servicio y por el Google Search Scraper y comparar los conjuntos de URLs, porque donde dos buscadores discrepan suele haber algo interesante. Y una página de resultados de una consulta de categoría más ciudad es una lista de leads en cuanto la columna url pasa por el Email & Contact Scraper. En lo legal, un puesto, un enlace y un fragmento son hechos sobre páginas web públicas y ninguna de las cinco columnas describe a una persona, aunque los fragmentos son el texto protegido de los sitios indexados, lo que hace que el análisis interno sea corriente y la republicación una pregunta aparte. Solo páginas de acceso público, sin rastreadores de terceros en la capa de datos, y las exportaciones se eliminan automáticamente a los 30 días. Tus primeras 500 filas son gratis y no necesitan tarjeta.