Scrapear los resultados de búsqueda de Tripadvisor a una hoja de cálculo
El Scraper de Búsqueda de Tripadvisor convierte una búsqueda en filas. Envías términos de búsqueda normales - del tipo que escribirías en el buscador del propio sitio - o URLs de tripadvisor.com/Search, una por línea o subidas como archivo CSV, XLSX, TXT o Parquet, fijas un límite por consulta y eliges si quieres todos los resultados o solo hoteles, restaurantes, cosas que hacer o alquileres vacacionales. Cada resultado vuelve como un registro con la consulta de la que salió, el nombre, la categoría, la valoración y el número de reseñas, la dirección, un enlace y una imagen. Ocho columnas, una fila por resultado, descargable como CSV, Excel o JSON.
Los nombres de columna de esta página son sólidos, y los contenidos de las celdas no se describen, porque todas las exportaciones que tenemos están vacías. Los ocho nombres y su orden están corroborados por dos fuentes independientes que coinciden exactamente: el array de columnas que la plataforma publica para este servicio y la cabecera de las siete exportaciones que tenemos, cada una declarando las mismas ocho celdas. Pero las siete son una cabecera sin filas debajo, y el propio mensaje del servicio nombra la razón: Tripadvisor usa protección antibots que bloquea las direcciones de centro de datos, y los resultados en vivo necesitan un proxy residencial. Así que aquí no hay valores de ejemplo, ni formatos, ni tasas de relleno: sin una ejecución poblada, serían inventados.
Hay un hueco estructural que conviene llevarse al esquema. La exportación tiene una columna rating y un recuento reviews, pero ningún max_rating, así que la escala en la que se apoya la valoración no se puede recuperar del propio archivo y hay que confirmarla en una primera ejecución real antes de comparar o promediar nada. Fíjate además en que reviews es un recuento y no texto de reseñas: en esta exportación no aparece ningún nombre de autor ni ningún cuerpo de reseña.
En lo legal, esta es de las exportaciones más ligeras de nuestro catálogo: páginas de resultados públicas, sin inicio de sesión ni muro de pago, y sin ninguna persona nombrada en ninguna de las ocho columnas. Son sitios, valoraciones y direcciones. Los propios términos de Tripadvisor siguen rigiendo la recopilación automatizada desde su web, así que léelos antes de escalar, y recuerda que las imágenes y los textos de las fichas son trabajo de otros si piensas republicarlos. Empieza gratis: tus primeras 500 filas no cuestan nada y no necesitan tarjeta, y después son 0,002 $ por fila, tarifa plana.