Scraper les résultats de recherche Tripadvisor dans un tableur
Le Scraper de Recherche Tripadvisor transforme une recherche en lignes. Vous soumettez de simples termes de recherche - le genre de chose que vous taperiez dans la barre de recherche du site - ou des URL tripadvisor.com/Search, une par ligne ou téléversées en CSV, XLSX, TXT ou Parquet, vous fixez une limite par requête, et vous choisissez si vous voulez tous les résultats ou seulement les hôtels, les restaurants, les choses à faire ou les locations de vacances. Chaque résultat revient sous forme d'enregistrement avec la requête dont il provient, le nom, la catégorie, la note et le nombre d'avis, l'adresse, un lien et une image. Huit colonnes, une ligne par résultat, téléchargeables en CSV, Excel ou JSON.
Les noms de colonnes de cette page sont solides, et les contenus des cellules ne sont pas décrits, parce que chaque export que nous détenons est vide. Les huit noms et leur ordre sont corroborés par deux sources indépendantes qui concordent exactement : le tableau de colonnes que la plateforme publie pour ce service, et la ligne d'en-tête des sept exports que nous détenons, déclarant chacun les mêmes huit cellules. Mais les sept sont un en-tête sans rien en dessous, et le message du service lui-même en nomme la raison - Tripadvisor utilise une protection anti-bots qui bloque les adresses de centre de données, et des résultats en direct exigent un proxy résidentiel. Il n'y a donc ici aucune valeur d'exemple, aucun format et aucun taux de remplissage : sans exécution renseignée, ils seraient inventés.
Un manque structurel mérite d'être emporté dans votre schéma. L'export a une colonne rating et un compteur reviews, mais pas de max_rating, si bien que l'échelle sur laquelle repose la note ne peut pas être récupérée depuis le fichier lui-même et doit être confirmée lors d'une première exécution réelle avant de comparer ou de moyenner quoi que ce soit. Notez aussi que reviews est un compteur et non du texte d'avis - aucun nom d'auteur et aucun corps d'avis n'apparaît dans cet export.
Sur le plan juridique, c'est l'un des exports les plus légers de notre catalogue : des pages de résultats publiques, sans identifiant ni paywall, et aucune personne nommée dans aucune des huit colonnes. Ce sont des lieux, des notes et des adresses. Les conditions de Tripadvisor régissent toujours la collecte automatisée depuis leur site, lisez-les donc avant de passer à l'échelle, et souvenez-vous que les images et les textes des fiches sont le travail de quelqu'un d'autre si vous comptez les republier. Commencez gratuitement : vos 500 premières lignes ne coûtent rien et ne demandent pas de carte, et ensuite c'est 0,002 $ par ligne, forfaitaire.