Extracteur de recherche Yahoo

Une page de résultats Yahoo,
ligne par ligne.

Soumettez une requête et récupérez ce que Yahoo a affiché, sous forme de tableau : le rang, le titre, le lien et l’extrait, une ligne par résultat. Cinq colonnes, et dans les 360 lignes derrière cette page chacune d’elles était remplie sur chaque ligne.

500 lignes gratuites, une seule foispuis 0,002 $ par lignecinq colonnes par résultatCSV · JSON · Excel
Comment ça marche

Une requête en entrée, un tableau classé en sortie.

  1. ÉTAPE 1Connectez-vous à la plateforme.
  2. ÉTAPE 2Ouvrez le Yahoo Search Scraper.
  3. ÉTAPE 3Saisissez les requêtes voulues, une par ligne.
  4. ÉTAPE 4Choisissez votre format de sortie (CSV / JSON / XLSX).
  5. ÉTAPE 5Lancez le job.
  6. ÉTAPE 6Téléchargez les résultats - une ligne par résultat, cinq colonnes.
À quoi ressemble vraiment l’export

Cinq colonnes, et deux choses à savoir.

Rien n’est jamais vide

Sur les 360 lignes que nous détenons, query, position, title, url et description étaient renseignées sur absolument chaque ligne. Pas une seule cellule vide dans tout l’export. C’est assez inhabituel pour être dit : la plupart des sources vous laissent écrire des vérifications de valeurs nulles.

position est un nombre, et il est continu

Dans les cinq exécutions, position allait de 1, 2, 3 … N sans trou et sans répétition. Vous pouvez donc trier dessus directement, et un numéro manquant signifie qu’une ligne s’est perdue dans votre pipeline, pas pendant le scraping.

La même URL peut apparaître deux fois

C’est le point qui surprend. À l’intérieur d’une même exécution, la colonne url se répète - 20 lignes en double dans un export de 74 lignes, et 4, 9, 11 et 16 dans les autres. Ce sont de vraies lignes à de vraies positions, pas un défaut d’export. Dédupliquez sur url avant de compter quoi que ce soit.

Un jeu de résultats n’est pas stable d’un jour à l’autre

Nous avons lancé python web scraping deux fois, à 24 heures d’intervalle. 66 URL distinctes le premier jour, 62 le second, et seulement 42 dans les deux - environ un tiers a été renouvelé. Sur les 42 survivantes, 22 occupaient une position différente. Traitez une exécution comme un instantané, pas comme le classement.

Les extraits sont du vrai texte, parfois tronqué

Les descriptions allaient de 6 à 417 caractères, médiane 194, et 79 des 360 se terminaient par des points de suspension - Yahoo les a coupées. Prévoyez une colonne texte large et ne prenez pas un « … » final pour un problème de données.

Les titres portent parfois l’URL affichée

Neuf des 360 titres commençaient par un domaine de fil d’Ariane espacé, comme www. python .org › downloads Download Python. C’est une minorité, mais si vous faites une correspondance sur les titres, cela vous surprendra. Retirez ce fragment de domaine initial ou faites la correspondance sur url.

Ce que vous récupérez

Cinq colonnes, par résultat.

Lues dans l’en-tête d’un export réel de ce service, dans l’ordre de la feuille. Chaque description ci-dessous s’appuie sur les 360 lignes que nous avons mesurées.

query
Le terme que vous avez soumis, répété sur chaque ligne pour qu’un export couvrant plusieurs requêtes reste séparable. Chacune de nos cinq exécutions portait exactement une requête ; c’est cette colonne qui permet de les fusionner.
position
Le rang, sous forme de nombre. Continu à partir de 1, sans trou ni répétition dans les cinq exécutions - 1 à 74, 1 à 70, 1 à 73, 1 à 69 et 1 à 74. Triez là-dessus plutôt que sur l’ordre des lignes.
title
Le titre du résultat. En général le titre de la page ; sur 9 de nos 360 lignes, il commençait par un domaine affiché espacé tel que www. python .org › downloads avant le vrai titre.
url
Le lien de destination. 358 sur 360 étaient en https et 2 en http, répartis sur 168 hôtes distincts. Cette colonne se répète à l’intérieur d’une exécution - dédupliquez dessus.
description
L’extrait sous le résultat. De 6 à 417 caractères, médiane 194, dont 79 sur 360 se terminant par des points de suspension là où Yahoo a tronqué.

Cinq colonnes par ligne · CSV, JSON ou Excel

Mesuré sur 5 exécutions réelles et 360 lignes : python (74 lignes), snake (69), titan (74) et python web scraping deux fois (70 et 73). Le nombre de lignes par requête a varié entre 69 et 74 : il n’y a donc pas de taille de page fixe sur laquelle compter - lisez les lignes que vous obtenez plutôt que de supposer un chiffre rond.

Cas d’usage courants

À quoi sert un second moteur de recherche.

Suivi de position

Surveiller une position dans le temps, pas une seule fois

Lancez les mêmes requêtes de façon planifiée et conservez query, url, position et la date d’exécution. Nos deux exécutions à un jour d’intervalle ont déplacé 22 des 42 URL communes : une seule lecture dit très peu, une série dit beaucoup.

SEO · Reporting
Visibilité concurrentielle

Voir qui d’autre se positionne sur vos termes

Groupez par hôte et comptez. Nos 360 lignes couvraient 168 hôtes distincts, et c’est exactement la question : qui revient sans cesse sur les requêtes qui vous intéressent, et à quelle profondeur.

SEO · Études de marché
Contrôle de couverture

Comparer Yahoo à Google

Passez la même liste de requêtes par ce service et par le Google Search Scraper, puis comparez les ensembles d’URL. Là où les deux divergent, un audit trouve généralement quelque chose.

SEO · Audit
Génération de leads

Transformer une page de résultats en liste

Une requête du type catégorie plus ville renvoie des pages de prestataires par dizaines. Passez la colonne url dans l’Email & Contact Scraper et la SERP devient une liste contactable.

Ventes · Prospection
Tarifs

Ne payez que ce que vous utilisez réellement.

Offre gratuite

Les 500 premières lignes sont gratuites

Une seule fois, à l’inscription. Sans carte, et rien à résilier ensuite.

Une seule fois, à l’inscription
Tarif

puis 0,002 $ par ligne

Facturé sur les lignes réellement renvoyées. Avec les 69 à 74 lignes qu’une requête a renvoyées dans nos exécutions, 500 lignes gratuites représentent environ sept requêtes avant le moindre prélèvement.

Facturé sur les lignes renvoyées
Sans abonnement

Rien de récurrent

Les crédits n’expirent pas selon un cycle mensuel. Lancez un lot maintenant et plus rien jusqu’à ce que vous en ayez besoin.

Pas d’expiration mensuelle
10 % de remise sur votre première exécution payante.Utilisez le code LIVESCRAPER10 au paiement.
S’inscrire
S’associe bien avec

Le reste de la famille recherche.

Le point juridique

Est-il légal de scraper les résultats Yahoo ?

Une page de résultats est une page publique, et les cinq colonnes décrivent ici des pages web, pas des personnes. Les réserves portent sur le volume et la réutilisation.

Lire une page de résultats, c’est ce que fait chaque visiteur, et un rang, un titre, un lien et un extrait sont des faits concernant des pages web publiquement accessibles. Rien dans l’export n’identifie une personne : pas de nom, pas d’e-mail, pas de numéro de téléphone, pas de compte - les questions de protection des données qui encadrent nos services portant sur des personnes ne se posent donc pas ici.

Deux choses méritent d’être dites clairement. D’abord, les extraits et les titres sont écrits par les sites indexés, pas par nous, et il s’agit de leur texte protégé par le droit d’auteur. Les utiliser en interne pour du suivi de position, de l’analyse concurrentielle et des audits est une pratique courante ; les republier comme contenu propre est une autre question, avec une autre réponse. Ensuite, il s’agit d’un instantané et non d’un classement : nos deux exécutions de la même requête à un jour d’intervalle ne partageaient que 42 URL sur environ 64, si bien que toute conclusion tirée d’un export unique est plus fragile qu’elle n’en a l’air. Lancez une série.

Nos propres conditions sont les mêmes que pour tous les autres services ici. Uniquement des pages publiquement accessibles, rien derrière une authentification, aucun traceur tiers sur la couche de données, et les exports sont supprimés automatiquement au bout de 30 jours. Vos 500 premières lignes sont gratuites et ne nécessitent aucune carte bancaire.

livescraper.app · ce qui façonne une exécution
Une requête par jeu de lignes
Nombre de lignes entre 69 et 74 dans nos exécutions
position est continue à partir de 1
url se répète - dédupliquez avant de compter!
Les exports sont supprimés au bout de 30 jours
Les résultats changent d’un jour à l’autre. Sur la seule requête lancée deux fois, un tiers des URL a été renouvelé en 24 heures.
Questions fréquentes

Ce que les gens demandent avant de s’inscrire.

Quelles colonnes contiendra l’export ?+
Cinq : query, position, title, url et description. Une ligne par résultat. Sur les 360 lignes derrière cette page, chacune de ces cinq colonnes était remplie sur chaque ligne - il n’y avait pas une seule cellule vide.
Combien de résultats renvoie une requête ?+
Cela varie. Nos cinq exécutions ont renvoyé 74, 70, 73, 69 et 74 lignes : il n’y a donc pas de taille de page fixe pour planifier. Lisez les lignes que vous obtenez plutôt que de supposer un chiffre rond.
Pourquoi la même URL apparaît-elle plusieurs fois ?+
Parce que Yahoo l’affiche plusieurs fois. À l’intérieur d’une seule exécution, nous avons compté 20 lignes en double dans un export de 74 lignes, et 4, 9, 11 et 16 dans les autres. Elles occupent des positions réelles et distinctes. Dédupliquez sur url avant de compter des hôtes ou de mesurer une part de résultats.
Les résultats seront-ils les mêmes si je relance la requête demain ?+
Non. Nous avons lancé python web scraping deux fois, à 24 heures d’intervalle : 66 URL distinctes le premier jour, 62 le second, 42 présentes dans les deux. Sur ces 42, 22 avaient changé de position. Même le top dix partageait 9 URL sur 10, mais pas dans le même ordre. Traitez une exécution comme un instantané et suivez une série s’il vous faut une tendance.
Puis-je trier sur la colonne position ?+
Oui. C’est un nombre, et dans les cinq exécutions il allait continûment de 1 à N, sans trou ni répétition. Un numéro manquant dans vos données signifie donc qu’une ligne a été perdue dans votre pipeline, pas pendant le scraping.
Pourquoi certains titres commencent-ils par quelque chose comme « www. python .org » ?+
Yahoo fait parfois précéder le titre de l’URL affichée en fil d’Ariane. C’est arrivé sur 9 de nos 360 lignes. Si vous faites une correspondance sur les titres, retirez ce fragment initial - ou faites-la sur url, qui n’a pas ce problème.
Combien ça coûte ?+
Vos 500 premières lignes sont gratuites, une seule fois, sans carte. Ensuite, c’est 0,002 $ par ligne, facturé sur les lignes réellement renvoyées. Avec les 69 à 74 lignes qu’une requête a renvoyées dans nos exécutions, l’offre gratuite couvre environ sept requêtes.
Dans quels formats puis-je exporter ?+
CSV, JSON ou Excel. Les cinq colonnes et leur ordre sont identiques dans les trois.

Mettez une page de résultats dans un tableur.

Cinq colonnes par résultat, remplies sur chaque ligne. Vos 500 premières lignes sont gratuites, puis 0,002 $ chacune.

Activation immédiate · sans carte bancaire

Scraper les résultats de recherche Yahoo

Le Yahoo Search Scraper prend une requête et renvoie la page de résultats sous forme de lignes : query, position, title, url et description, une ligne par résultat. Cinq exécutions et 360 lignes se trouvent derrière cette page, et chacune de ces cinq colonnes était renseignée sur chacune de ces lignes - aucune cellule vide nulle part dans l’export. position revient sous forme de nombre continu à partir de 1 : il se trie directement, et un trou dans vos données signifie qu’une ligne a été perdue en aval plutôt que pendant le scraping.

Deux propriétés des données comptent plus que le schéma. La première est la duplication : à l’intérieur d’une même exécution, la colonne url se répète, 20 fois dans un export de 74 lignes et 4, 9, 11 et 16 fois dans les autres. Ce sont de véritables lignes à de véritables positions, si bien que tout comptage d’hôtes, de domaines ou de part de résultats doit d’abord dédupliquer. La seconde est la volatilité. Nous avons lancé la requête python web scraping deux jours de suite : 66 URL distinctes le premier jour, 62 le second, et seulement 42 présentes dans les deux. Sur ces 42 survivantes, 22 avaient changé de position, et même le top dix partageait neuf URL sur dix dans un ordre différent. Un export unique est l’instantané d’un moment, et un programme de suivi de position bâti sur une lecture par trimestre rapportera du bruit comme s’il s’agissait de mouvement.

Les volumes de lignes ne sont pas fixes non plus - nos cinq exécutions ont renvoyé 74, 70, 73, 69 et 74 lignes pour une requête chacune. Les extraits allaient de 6 à 417 caractères pour une médiane de 194, et 79 des 360 se terminaient par des points de suspension là où Yahoo a tronqué : la colonne description réclame donc un type texte large plutôt qu’un varchar court. Les titres sont en général le titre de la page, mais sur 9 des 360 lignes ils s’ouvraient sur un domaine affiché espacé tel que www. python .org › downloads ; une correspondance sur url évite complètement le problème. Sur l’ensemble des 360 lignes, on comptait 168 hôtes distincts, 358 liens https et 2 http.

Les usages courants découlent de cette forme. Le suivi de position fonctionne si vous menez une série plutôt qu’un export isolé. La visibilité concurrentielle est un regroupement par hôte. Auditer la couverture consiste à passer la même liste de requêtes par ce service et par le Google Search Scraper puis à comparer les ensembles d’URL, car là où deux moteurs divergent se cache généralement quelque chose d’intéressant. Et une page de résultats pour une requête catégorie plus ville devient une liste de leads dès que la colonne url passe par l’Email & Contact Scraper. Sur le plan juridique, un rang, un lien et un extrait sont des faits concernant des pages web publiques et aucune des cinq colonnes ne décrit une personne - même si les extraits sont le texte protégé des sites indexés, ce qui rend l’analyse interne ordinaire et la republication une question distincte. Uniquement des pages publiquement accessibles, aucun traceur tiers sur la couche de données, et les exports sont supprimés automatiquement au bout de 30 jours. Vos 500 premières lignes sont gratuites et ne nécessitent aucune carte bancaire.