Scraper les résultats de recherche Yahoo
Le Yahoo Search Scraper prend une requête et renvoie la page de résultats sous forme de lignes : query, position, title, url et description, une ligne par résultat. Cinq exécutions et 360 lignes se trouvent derrière cette page, et chacune de ces cinq colonnes était renseignée sur chacune de ces lignes - aucune cellule vide nulle part dans l’export. position revient sous forme de nombre continu à partir de 1 : il se trie directement, et un trou dans vos données signifie qu’une ligne a été perdue en aval plutôt que pendant le scraping.
Deux propriétés des données comptent plus que le schéma. La première est la duplication : à l’intérieur d’une même exécution, la colonne url se répète, 20 fois dans un export de 74 lignes et 4, 9, 11 et 16 fois dans les autres. Ce sont de véritables lignes à de véritables positions, si bien que tout comptage d’hôtes, de domaines ou de part de résultats doit d’abord dédupliquer. La seconde est la volatilité. Nous avons lancé la requête python web scraping deux jours de suite : 66 URL distinctes le premier jour, 62 le second, et seulement 42 présentes dans les deux. Sur ces 42 survivantes, 22 avaient changé de position, et même le top dix partageait neuf URL sur dix dans un ordre différent. Un export unique est l’instantané d’un moment, et un programme de suivi de position bâti sur une lecture par trimestre rapportera du bruit comme s’il s’agissait de mouvement.
Les volumes de lignes ne sont pas fixes non plus - nos cinq exécutions ont renvoyé 74, 70, 73, 69 et 74 lignes pour une requête chacune. Les extraits allaient de 6 à 417 caractères pour une médiane de 194, et 79 des 360 se terminaient par des points de suspension là où Yahoo a tronqué : la colonne description réclame donc un type texte large plutôt qu’un varchar court. Les titres sont en général le titre de la page, mais sur 9 des 360 lignes ils s’ouvraient sur un domaine affiché espacé tel que www. python .org › downloads ; une correspondance sur url évite complètement le problème. Sur l’ensemble des 360 lignes, on comptait 168 hôtes distincts, 358 liens https et 2 http.
Les usages courants découlent de cette forme. Le suivi de position fonctionne si vous menez une série plutôt qu’un export isolé. La visibilité concurrentielle est un regroupement par hôte. Auditer la couverture consiste à passer la même liste de requêtes par ce service et par le Google Search Scraper puis à comparer les ensembles d’URL, car là où deux moteurs divergent se cache généralement quelque chose d’intéressant. Et une page de résultats pour une requête catégorie plus ville devient une liste de leads dès que la colonne url passe par l’Email & Contact Scraper. Sur le plan juridique, un rang, un lien et un extrait sont des faits concernant des pages web publiques et aucune des cinq colonnes ne décrit une personne - même si les extraits sont le texte protégé des sites indexés, ce qui rend l’analyse interne ordinaire et la republication une question distincte. Uniquement des pages publiquement accessibles, aucun traceur tiers sur la couche de données, et les exports sont supprimés automatiquement au bout de 30 jours. Vos 500 premières lignes sont gratuites et ne nécessitent aucune carte bancaire.