Google Search Autocomplete - sugerencias de búsqueda en filas estructuradas
El autocompletado es la lista de completaciones que Google ofrece bajo la caja de búsqueda mientras escribes, y una de las señales públicas más útiles de la web. Sale de lo que la gente busca de verdad, lo que lo convierte en una lectura directa de cómo se formula la demanda en vez de una estimación modelada de ella, y a diferencia de una herramienta de keywords saca a la superficie la cola larga que es demasiado pequeña para reportar un volumen. El inconveniente es que existe durante una fracción de segundo dentro de un desplegable. Este servicio lo convierte en una tabla: una fila por sugerencia, tres columnas, exportadas en CSV, JSON o Excel, para tantos términos semilla como quieras enviar.
La exportación tiene una forma inusualmente predecible, y esa es su mejor característica. Cada término semilla devuelve exactamente diez sugerencias -se cumplió en todos los bloques que medimos, sin bloques cortos ni largos-, así que el tamaño de un trabajo es simplemente tu número de semillas por diez, conocido antes de gastar nada. La referencia publicada acepta el parámetro query como array y agrupa hasta mil consultas por petición, de modo que una lista grande de semillas es un único trabajo. Dos parámetros opcionales hacen el resto: language, que por defecto es inglés, y region, cuyo uso recomienda la referencia para una mejor experiencia de búsqueda. El autocompletado depende mucho de la configuración regional, así que merece la pena fijar ambos a conciencia y anotarlos por separado: ninguna de las tres columnas de salida te dice después de qué configuración regional salió una fila.
Conviene prever dos propiedades de los propios datos. La primera es que position es un puesto dentro del desplegable de una consulta y no un número de fila: va de 1 a 10 y luego reinicia para la semilla siguiente, así que un archivo de cincuenta semillas contiene el número 1 cincuenta veces, y agrupar por query tiene que preceder a cualquier ordenación. La segunda es que la sugerencia superior es tu propia semilla devuelta: ocurrió en todos los bloques que medimos. Es Google ofreciendo la cadena literal como primera opción, y significa que diez filas por consulta son en realidad nueve formulaciones nuevas más un eco. Ninguna de las dos cosas es un fallo, pero ambas distorsionan en silencio un recuento ingenuo, y una cifra de sugerencias por semilla que incluya el eco está sobrevalorada en torno a una décima parte.
Una nota honesta sobre la volatilidad, y corta por los dos lados. Ejecutamos varias semillas más de una vez. Una devolvió un top diez idéntico byte a byte; otra devolvió las mismas diez cadenas reordenadas; una tercera compartió ocho de diez con su ejecución anterior. Así que la lista no es ni fija ni aleatoria: deriva. Eso es lo que hace que merezca la pena muestrearla repetidamente en vez de una sola vez, y también por qué nada en estas tres columnas debería tratarse como identificador estable: construye una clave con la consulta y la sugerencia juntas, guarda la fecha de cada ejecución y deja que un movimiento de puesto se gane su interpretación a lo largo de varias muestras en vez de una. Empieza gratis: tus primeras 500 filas no cuestan nada y no necesitan tarjeta.