Yahoo Such-Scraper

Eine Yahoo-Ergebnisseite,
Zeile für Zeile.

Geben Sie eine Suchanfrage ein und erhalten Sie zurück, was Yahoo angezeigt hat - als Tabelle mit Rang, Titel, Link und Snippet, eine Zeile je Treffer. Fünf Spalten, und in den 360 Zeilen hinter dieser Seite war jede einzelne davon in jeder Zeile gefüllt.

einmalig 500 Zeilen gratisdanach 0,002 $ pro Zeilefünf Spalten je TrefferCSV · JSON · Excel
So funktioniert es

Eine Suchanfrage rein, eine sortierte Tabelle raus.

  1. SCHRITT 1Melden Sie sich auf der Plattform an.
  2. SCHRITT 2Öffnen Sie den Yahoo Search Scraper.
  3. SCHRITT 3Tragen Sie die gewünschten Suchanfragen ein, eine pro Zeile.
  4. SCHRITT 4Wählen Sie Ihr Ausgabeformat (CSV / JSON / XLSX).
  5. SCHRITT 5Starten Sie den Job.
  6. SCHRITT 6Laden Sie die Ergebnisse herunter - eine Zeile je Treffer, fünf Spalten.
Wie der Export wirklich aussieht

Fünf Spalten und zwei Dinge, die man wissen muss.

Nichts ist jemals leer

In allen 360 Zeilen, die wir haben, waren query, position, title, url und description in jeder einzelnen Zeile gefüllt. Keine einzige leere Zelle im gesamten Export. Das ist ungewöhnlich genug, um es zu erwähnen - bei den meisten Quellen schreiben Sie ständig Null-Prüfungen.

position ist eine Zahl, und sie ist lückenlos

In allen fünf Läufen lief position 1, 2, 3 … N ohne Lücken und ohne Wiederholungen. Sie können also direkt danach sortieren, und eine fehlende Nummer bedeutet, dass eine Zeile in Ihrer Pipeline verloren ging und nicht beim Scrapen.

Dieselbe URL kann zweimal auftauchen

Das ist der Punkt, der überrascht. Innerhalb eines einzigen Laufs wiederholt sich die Spalte url - 20 doppelte Zeilen in einem Export mit 74 Zeilen, und 4, 9, 11 und 16 in den anderen. Es sind echte Zeilen an echten Positionen, kein Exportfehler. Deduplizieren Sie nach url, bevor Sie irgendetwas zählen.

Eine Trefferliste ist über Nacht nicht stabil

Wir haben python web scraping zweimal im Abstand von 24 Stunden ausgeführt. 66 verschiedene URLs am ersten Tag, 62 am zweiten, und nur 42 in beiden - rund ein Drittel wurde ausgetauscht. Von den 42 verbliebenen standen 22 an einer anderen Position. Behandeln Sie einen einzelnen Lauf als Momentaufnahme, nicht als das Ranking.

Snippets sind echter Text, manchmal gekürzt

Die Beschreibungen reichten von 6 bis 417 Zeichen, im Median 194, und 79 der 360 endeten mit Auslassungspunkten - Yahoo hat sie abgeschnitten. Planen Sie eine breite Textspalte ein und werten Sie ein abschließendes „…“ nicht als Datenproblem.

Titel tragen gelegentlich die Anzeige-URL

Neun der 360 Titel begannen mit einer auseinandergezogenen Breadcrumb-Domain, etwa www. python .org › downloads Download Python. Es ist eine Minderheit, aber wenn Sie über Titel abgleichen, wird es Sie überraschen. Entfernen Sie das führende Domain-Fragment oder gleichen Sie stattdessen über url ab.

Was Sie zurückbekommen

Fünf Spalten, je Treffer.

Aus der Kopfzeile eines echten Exports dieses Dienstes gelesen, in der Reihenfolge des Tabellenblatts. Jede Beschreibung unten stützt sich auf die 360 Zeilen, die wir gemessen haben.

query
Der Suchbegriff, den Sie übermittelt haben, in jeder Zeile wiederholt, damit ein Export über mehrere Anfragen trennbar bleibt. Jeder unserer fünf Läufe trug genau eine Anfrage; diese Spalte ist es, die das Zusammenführen ermöglicht.
position
Der Rang, als Zahl. Lückenlos ab 1, ohne Lücken und ohne Wiederholungen in allen fünf Läufen - 1 bis 74, 1 bis 70, 1 bis 73, 1 bis 69 und 1 bis 74. Sortieren Sie danach statt nach der Zeilenreihenfolge.
title
Die Überschrift des Treffers. Normalerweise der Seitentitel; in 9 unserer 360 Zeilen begann sie mit einer auseinandergezogenen Anzeige-Domain wie www. python .org › downloads vor dem eigentlichen Titel.
url
Der Ziel-Link. 358 von 360 waren https und 2 waren http, verteilt auf 168 verschiedene Hosts. Diese Spalte wiederholt sich innerhalb eines Laufs - deduplizieren Sie danach.
description
Das Snippet unter dem Treffer. 6 bis 417 Zeichen, im Median 194, wobei 79 von 360 mit Auslassungspunkten enden, wo Yahoo gekürzt hat.

Fünf Spalten pro Zeile · CSV, JSON oder Excel

Gemessen an 5 echten Läufen und 360 Zeilen: python (74 Zeilen), snake (69), titan (74) und python web scraping zweimal (70 und 73). Die Zeilenzahl je Anfrage schwankte zwischen 69 und 74, es gibt also keine feste Seitengröße, auf die man sich verlassen könnte - lesen Sie die Zeilen, die Sie bekommen, statt eine runde Zahl anzunehmen.

Typische Workflows

Wofür eine zweite Suchmaschine gut ist.

Rank-Tracking

Eine Position über die Zeit beobachten, nicht einmalig

Führen Sie dieselben Anfragen nach Zeitplan aus und behalten Sie query, url, position und das Laufdatum. Unsere eigenen zwei Läufe im Abstand eines Tages verschoben 22 von 42 gemeinsamen URLs - eine einzelne Messung sagt also sehr wenig, eine Reihe sagt viel.

SEO · Reporting
Wettbewerbssichtbarkeit

Sehen, wer sonst für Ihre Begriffe rankt

Nach Host gruppieren und zählen. Unsere 360 Zeilen umfassten 168 verschiedene Hosts, und genau das ist die Frage - wer taucht über die Anfragen, die Sie interessieren, immer wieder auf, und in welcher Tiefe.

SEO · Marktforschung
Abdeckungsprüfung

Yahoo mit Google vergleichen

Lassen Sie dieselbe Anfrageliste hier und über den Google Search Scraper laufen und vergleichen Sie dann die URL-Mengen. Wo die beiden abweichen, findet ein Audit meist etwas.

SEO · Audit
Lead-Gewinnung

Aus einer Ergebnisseite eine Liste machen

Eine Anfrage aus Kategorie plus Stadt liefert Anbieterseiten im Dutzend. Geben Sie die Spalte url in den Email & Contact Scraper und aus der SERP wird eine kontaktierbare Liste.

Vertrieb · Prospecting
Preise

Zahlen Sie nur, was Sie tatsächlich nutzen.

Gratis-Kontingent

Die ersten 500 Zeilen sind gratis

Einmalig, bei der Anmeldung. Keine Karte, und nichts, was danach gekündigt werden müsste.

Einmalig, bei der Anmeldung
Preis

danach 0,002 $ pro Zeile

Abgerechnet nach tatsächlich gelieferten Zeilen. Bei den 69 bis 74 Zeilen, die eine Anfrage in unseren Läufen lieferte, reichen 500 Gratis-Zeilen für rund sieben Anfragen, bevor überhaupt etwas berechnet wird.

Abgerechnet nach gelieferten Zeilen
Kein Abo

Nichts Wiederkehrendes

Guthaben verfällt nicht im Monatsrhythmus. Führen Sie jetzt einen Durchlauf aus und danach nichts mehr, bis Sie es brauchen.

Kein monatlicher Verfall
10 % Rabatt auf Ihren ersten bezahlten Lauf.Verwenden Sie beim Checkout den Code LIVESCRAPER10.
Registrieren
Passt gut zusammen mit

Der Rest der Suchfamilie.

Das Rechtliche

Ist es legal, Yahoo-Ergebnisse zu scrapen?

Eine Ergebnisseite ist eine öffentliche Seite, und die fünf Spalten hier beschreiben Webseiten, keine Personen. Die Einschränkungen betreffen Umfang und Weiterverwendung.

Eine Suchergebnisseite zu lesen, ist das, was jeder Besucher tut, und ein Rang, ein Titel, ein Link und ein Snippet sind Fakten über öffentlich erreichbare Webseiten. Nichts im Export identifiziert eine Person: kein Name, keine E-Mail-Adresse, keine Telefonnummer, kein Konto - die datenschutzrechtlichen Fragen, die unsere personenbezogenen Dienste prägen, stellen sich hier also nicht.

Zwei Dinge sind klar zu benennen. Erstens: Snippets und Titel stammen von den indexierten Seiten, nicht von uns, und sie sind deren urheberrechtlich geschützter Text. Sie intern für Rank-Tracking, Wettbewerbsanalysen und Audits zu nutzen, ist gängige Praxis; sie als eigene Inhalte zu veröffentlichen, ist eine andere Frage mit einer anderen Antwort. Zweitens: Das hier ist eine Momentaufnahme, kein Ranking - unsere eigenen zwei Läufe derselben Anfrage im Abstand eines Tages teilten nur 42 von rund 64 URLs, jede aus einem einzelnen Export gezogene Schlussfolgerung ist also schwächer, als sie aussieht. Führen Sie eine Reihe aus.

Unsere eigenen Bedingungen sind dieselben wie bei jedem anderen Dienst hier. Nur öffentlich zugängliche Seiten, nichts hinter einem Login, keine Tracker Dritter auf der Datenebene, und Exporte werden nach 30 Tagen automatisch gelöscht. Ihre ersten 500 Zeilen sind gratis und brauchen keine Kreditkarte.

livescraper.app · was einen Lauf prägt
Eine Anfrage je Zeilensatz
Zeilenzahl schwankte in unseren Läufen zwischen 69 und 74
position läuft lückenlos ab 1
url wiederholt sich - vor dem Zählen deduplizieren!
Exporte werden nach 30 Tagen automatisch gelöscht
Ergebnisse ändern sich von Tag zu Tag. Bei der einen Anfrage, die wir zweimal ausgeführt haben, wurde ein Drittel der URLs innerhalb von 24 Stunden ausgetauscht.
Häufige Fragen

Was Leute fragen, bevor sie sich anmelden.

Welche Spalten enthält der Export?+
Fünf: query, position, title, url und description. Eine Zeile je Treffer. In den 360 Zeilen hinter dieser Seite war jede dieser fünf in jeder Zeile gefüllt - es gab keine einzige leere Zelle.
Wie viele Treffer liefert eine Anfrage?+
Das schwankt. Unsere fünf Läufe lieferten 74, 70, 73, 69 und 74 Zeilen, es gibt also keine feste Seitengröße, mit der man planen könnte. Lesen Sie die Zeilen, die Sie bekommen, statt eine runde Zahl anzunehmen.
Warum taucht dieselbe URL mehrfach auf?+
Weil Yahoo sie mehrfach anzeigt. Innerhalb eines einzigen Laufs zählten wir 20 doppelte Zeilen in einem Export mit 74 Zeilen, und 4, 9, 11 und 16 in den anderen. Sie stehen an echten, verschiedenen Positionen. Deduplizieren Sie nach url, bevor Sie Hosts zählen oder Anteile messen.
Sind die Ergebnisse gleich, wenn ich die Anfrage morgen erneut ausführe?+
Nein. Wir haben python web scraping zweimal im Abstand von 24 Stunden ausgeführt: 66 verschiedene URLs am ersten Tag, 62 am zweiten, 42 in beiden. Von diesen 42 hatten 22 die Position gewechselt. Selbst die Top Ten teilten 9 von 10 URLs, aber nicht in derselben Reihenfolge. Behandeln Sie einen Lauf als Momentaufnahme und verfolgen Sie eine Reihe, wenn Sie einen Trend brauchen.
Kann ich nach der Spalte position sortieren?+
Ja. Sie ist eine Zahl und lief in allen fünf Läufen lückenlos von 1 bis N, ohne Lücken und ohne Wiederholungen. Eine fehlende Nummer in Ihren Daten bedeutet daher, dass eine Zeile in Ihrer Pipeline verloren ging und nicht beim Scrapen.
Warum beginnen manche Titel mit so etwas wie „www. python .org“?+
Yahoo stellt der Überschrift manchmal die Anzeige-URL als Breadcrumb voran. Das passierte in 9 unserer 360 Zeilen. Wenn Sie über Titel abgleichen, entfernen Sie dieses führende Fragment - oder gleichen Sie über url ab, wo das Problem nicht auftritt.
Was kostet es?+
Ihre ersten 500 Zeilen sind gratis, einmalig, ohne Karte. Danach sind es 0,002 $ pro Zeile, abgerechnet nach tatsächlich gelieferten Zeilen. Bei den 69 bis 74 Zeilen, die eine Anfrage in unseren Läufen lieferte, deckt das Gratis-Kontingent rund sieben Anfragen ab.
In welchen Formaten kann ich exportieren?+
CSV, JSON oder Excel. Die fünf Spalten und ihre Reihenfolge sind in allen dreien gleich.

Eine Ergebnisseite in eine Tabelle bringen.

Fünf Spalten je Treffer, in jeder Zeile gefüllt. Ihre ersten 500 Zeilen sind gratis, danach je 0,002 $.

Sofort aktiv · keine Karte erforderlich

Yahoo-Suchergebnisse scrapen

Der Yahoo Search Scraper nimmt eine Suchanfrage und liefert die Ergebnisseite als Zeilen zurück: query, position, title, url und description, eine Zeile je Treffer. Hinter dieser Seite stehen fünf Läufe und 360 Zeilen, und jede dieser fünf Spalten war in jeder dieser Zeilen gefüllt - nirgends im Export eine leere Zelle. position kommt als Zahl zurück, die lückenlos ab 1 läuft, sortiert also direkt, und eine Lücke in Ihren Daten bedeutet, dass eine Zeile nachgelagert verloren ging und nicht beim Scrapen.

Zwei Eigenschaften der Daten sind wichtiger als das Schema. Die erste ist Duplizierung: Innerhalb eines einzigen Laufs wiederholt sich die Spalte url, 20-mal in einem Export mit 74 Zeilen und 4, 9, 11 und 16 mal in den anderen. Das sind echte Zeilen an echten Positionen, jede Zählung von Hosts, Domains oder Ergebnisanteilen muss also zuerst deduplizieren. Die zweite ist Volatilität. Wir haben die Anfrage python web scraping an zwei aufeinanderfolgenden Tagen ausgeführt: 66 verschiedene URLs am ersten Tag, 62 am zweiten, und nur 42 tauchten in beiden auf. Von diesen 42 hatten 22 die Position gewechselt, und selbst die Top Ten teilten neun von zehn URLs in anderer Reihenfolge. Ein einzelner Export ist eine Momentaufnahme eines Augenblicks, und ein Rank-Tracking-Programm auf Basis einer Messung pro Quartal meldet Rauschen als Bewegung.

Auch die Zeilenzahlen liegen nicht fest - unsere fünf Läufe lieferten 74, 70, 73, 69 und 74 Zeilen für jeweils eine Anfrage. Snippets reichten von 6 bis 417 Zeichen bei einem Median von 194, und 79 der 360 endeten mit Auslassungspunkten, wo Yahoo gekürzt hat; die Spalte description braucht also einen breiten Texttyp statt eines kurzen Varchar. Titel sind meist der Seitentitel, aber in 9 der 360 Zeilen begannen sie mit einer auseinandergezogenen Anzeige-Domain wie www. python .org › downloads; ein Abgleich über url vermeidet das vollständig. Über alle 360 Zeilen hinweg gab es 168 verschiedene Hosts, 358 https-Links und 2 http.

Die üblichen Anwendungen folgen aus dieser Form. Rank-Tracking funktioniert, wenn Sie eine Reihe statt eines einzelnen Exports fahren. Wettbewerbssichtbarkeit ist eine Gruppierung nach Host. Abdeckungsprüfung heißt, dieselbe Anfrageliste hier und über den Google Search Scraper laufen zu lassen und die URL-Mengen zu vergleichen, denn wo zwei Suchmaschinen abweichen, sitzt meist etwas Interessantes. Und eine Ergebnisseite zu einer Anfrage aus Kategorie plus Stadt ist eine Lead-Liste, sobald die Spalte url durch den Email & Contact Scraper läuft. Rechtlich sind ein Rang, ein Link und ein Snippet Fakten über öffentliche Webseiten, und keine der fünf Spalten beschreibt eine Person - die Snippets sind allerdings der urheberrechtlich geschützte Text der indexierten Seiten, was interne Analysen gewöhnlich und eine Veröffentlichung zu einer eigenen Frage macht. Nur öffentlich zugängliche Seiten, keine Tracker Dritter auf der Datenebene, und Exporte werden nach 30 Tagen automatisch gelöscht. Ihre ersten 500 Zeilen sind gratis und brauchen keine Kreditkarte.