Hacer scraping de resultados de Yahoo
El Yahoo Search Scraper toma una consulta y devuelve la página de resultados como filas: query, position, title, url y description, una fila por resultado. Detrás de esta página hay cinco ejecuciones y 360 filas, y cada una de esas cinco columnas estaba rellena en cada una de esas filas: ninguna celda vacía en toda la exportación. position vuelve como un número correlativo desde 1, así que ordena directamente y un hueco en tus datos significa que se perdió una fila más adelante, no durante el scraping.
Dos propiedades de los datos importan más que el esquema. La primera es la duplicación: dentro de una sola ejecución la columna url se repite, 20 veces en una exportación de 74 filas y 4, 9, 11 y 16 veces en las demás. Son filas auténticas en posiciones auténticas, así que cualquier recuento de hosts, dominios o cuota de resultados tiene que deduplicar primero. La segunda es la volatilidad. Ejecutamos la consulta python web scraping dos días seguidos: 66 URLs distintas el primer día, 62 el segundo, y solo 42 aparecieron en ambas. De esas 42 supervivientes, 22 habían cambiado de posición, e incluso el top diez compartía nueve de diez URLs en otro orden. Una sola exportación es la instantánea de un momento, y un programa de seguimiento de posiciones basado en una lectura por trimestre informará de ruido como si fuera movimiento.
Los recuentos de filas tampoco son fijos: nuestras cinco ejecuciones devolvieron 74, 70, 73, 69 y 74 filas, con una consulta cada una. Los fragmentos fueron de 6 a 417 caracteres con una mediana de 194, y 79 de los 360 terminaron en puntos suspensivos donde Yahoo los recortó, así que la columna description pide un tipo de texto amplio y no un varchar corto. Los títulos suelen ser el título de la página, pero en 9 de las 360 filas empezaban con un dominio visible separado por espacios como www. python .org › downloads; comparar por url lo evita por completo. En las 360 filas hubo 168 hosts distintos, 358 enlaces https y 2 http.
Los usos habituales se derivan de esa forma. El seguimiento de posiciones funciona si lanzas una serie en lugar de una exportación única. La visibilidad competitiva es una agrupación por host. Auditar la cobertura significa pasar la misma lista de consultas por este servicio y por el Google Search Scraper y comparar los conjuntos de URLs, porque donde dos buscadores discrepan suele haber algo interesante. Y una página de resultados de una consulta de categoría más ciudad es una lista de leads en cuanto la columna url pasa por el Email & Contact Scraper. En lo legal, un puesto, un enlace y un fragmento son hechos sobre páginas web públicas y ninguna de las cinco columnas describe a una persona, aunque los fragmentos son el texto protegido de los sitios indexados, lo que hace que el análisis interno sea corriente y la republicación una pregunta aparte. Solo páginas de acceso público, sin rastreadores de terceros en la capa de datos, y las exportaciones se eliminan automáticamente a los 30 días. Tus primeras 500 filas son gratis y no necesitan tarjeta.