Yahoo-Suchergebnisse scrapen
Der Yahoo Search Scraper nimmt eine Suchanfrage und liefert die Ergebnisseite als Zeilen zurück: query, position, title, url und description, eine Zeile je Treffer. Hinter dieser Seite stehen fünf Läufe und 360 Zeilen, und jede dieser fünf Spalten war in jeder dieser Zeilen gefüllt - nirgends im Export eine leere Zelle. position kommt als Zahl zurück, die lückenlos ab 1 läuft, sortiert also direkt, und eine Lücke in Ihren Daten bedeutet, dass eine Zeile nachgelagert verloren ging und nicht beim Scrapen.
Zwei Eigenschaften der Daten sind wichtiger als das Schema. Die erste ist Duplizierung: Innerhalb eines einzigen Laufs wiederholt sich die Spalte url, 20-mal in einem Export mit 74 Zeilen und 4, 9, 11 und 16 mal in den anderen. Das sind echte Zeilen an echten Positionen, jede Zählung von Hosts, Domains oder Ergebnisanteilen muss also zuerst deduplizieren. Die zweite ist Volatilität. Wir haben die Anfrage python web scraping an zwei aufeinanderfolgenden Tagen ausgeführt: 66 verschiedene URLs am ersten Tag, 62 am zweiten, und nur 42 tauchten in beiden auf. Von diesen 42 hatten 22 die Position gewechselt, und selbst die Top Ten teilten neun von zehn URLs in anderer Reihenfolge. Ein einzelner Export ist eine Momentaufnahme eines Augenblicks, und ein Rank-Tracking-Programm auf Basis einer Messung pro Quartal meldet Rauschen als Bewegung.
Auch die Zeilenzahlen liegen nicht fest - unsere fünf Läufe lieferten 74, 70, 73, 69 und 74 Zeilen für jeweils eine Anfrage. Snippets reichten von 6 bis 417 Zeichen bei einem Median von 194, und 79 der 360 endeten mit Auslassungspunkten, wo Yahoo gekürzt hat; die Spalte description braucht also einen breiten Texttyp statt eines kurzen Varchar. Titel sind meist der Seitentitel, aber in 9 der 360 Zeilen begannen sie mit einer auseinandergezogenen Anzeige-Domain wie www. python .org › downloads; ein Abgleich über url vermeidet das vollständig. Über alle 360 Zeilen hinweg gab es 168 verschiedene Hosts, 358 https-Links und 2 http.
Die üblichen Anwendungen folgen aus dieser Form. Rank-Tracking funktioniert, wenn Sie eine Reihe statt eines einzelnen Exports fahren. Wettbewerbssichtbarkeit ist eine Gruppierung nach Host. Abdeckungsprüfung heißt, dieselbe Anfrageliste hier und über den Google Search Scraper laufen zu lassen und die URL-Mengen zu vergleichen, denn wo zwei Suchmaschinen abweichen, sitzt meist etwas Interessantes. Und eine Ergebnisseite zu einer Anfrage aus Kategorie plus Stadt ist eine Lead-Liste, sobald die Spalte url durch den Email & Contact Scraper läuft. Rechtlich sind ein Rang, ein Link und ein Snippet Fakten über öffentliche Webseiten, und keine der fünf Spalten beschreibt eine Person - die Snippets sind allerdings der urheberrechtlich geschützte Text der indexierten Seiten, was interne Analysen gewöhnlich und eine Veröffentlichung zu einer eigenen Frage macht. Nur öffentlich zugängliche Seiten, keine Tracker Dritter auf der Datenebene, und Exporte werden nach 30 Tagen automatisch gelöscht. Ihre ersten 500 Zeilen sind gratis und brauchen keine Kreditkarte.