NapaOnline-Produktdaten scrapen
NapaOnline ist der Onlinekatalog eines großen Autoteilehändlers, und diese Seite erscheint als negatives Ergebnis statt als Produktbeschreibung. Unser Exportordner für diesen Dienst hält sieben Läufe und sieben Zeilen, und nicht eine dieser Zeilen trägt einen Produktnamen, einen Preis, eine Artikelnummer oder ein Bild. Fünf davon melden blocked (needs residential proxy), und alle fünf übermittelten dieselbe echte Produkt-URL innerhalb einer einzigen Stunde am 3. Juli 2026 - in dem, was wir halten, ist die Abweisung also nicht zeitweise, sondern durchgängig. Die übrigen zwei Zeilen sind 404er gegen eine Platzhalteradresse, die es nicht gibt, und sagen über diese Seite gar nichts. Reduziert auf die Versuche, die zählen: fünf Anfragen, fünf Abweisungen.
Wir haben unabhängig nachgeprüft, statt dem Export zu glauben. Am 12. August 2026 haben wir diese Produktseite und die robots.txt der Seite von einer normalen Maschine mit Browser-User-Agent abgerufen, und beide lieferten HTTP 403. Keine der Antworten war NapaOnline-Markup: jede war eine Cloudflare-Abfrageseite, betitelt Just a moment…, als noindex und nofollow markiert, mit einer Content-Security-Policy, die Cloudflares eigenen Abfrage-Host nennt. Das ist eine Schutzschicht, die anstelle der Seite antwortet. Es bedeutet auch, dass wir die robots-Datei nie gelesen haben, weshalb diese Seite nichts daraus zitiert - keine Zusammenfassung, keine Behauptung darüber, welche Pfade erlaubt sind. Es sei hinzugefügt: Das ist ein anderer Anbieter als der, der eine andere blockierte Seite in unserem Katalog bewacht; wir benennen, was wir beobachtet haben, und verallgemeinern nicht darüber hinaus.
Was wir anbieten können, ist das Schema. Die siebzehn Spalten - query, sku_code, product_url, name, description, parsed_price, price, currency, availability, rating, reviews, images, brand, sku, url, image, status - sind aus der Kopfzeile eines echten NapaOnline-Exports gelesen, und dieser Teil der Datei ist wohlgeformt, auch wenn der Lauf nichts liefert. Sie sind zudem Byte für Byte dasselbe Schema wie hinter unseren Diensten für Uline, CDW, Waxie, Otto, Newegg, Decathlon und Menards; ein Importer, der gegen einen davon geschrieben ist, nimmt eine NapaOnline-Datei unverändert an, falls und sobald Zeilen ankommen. Das Datenverzeichnis auf dieser Seite beschreibt deshalb, wofür jede Spalte da ist, und hält Spalte für Spalte fest, dass wir sie nicht gefüllt beobachtet haben. Es nennt keine Füllzahlen, weil es nichts zu zählen gibt.
Eine redaktionelle Entscheidung verdient es, ausgesprochen zu werden. Mehrere Dienste auf dieser Seite teilen genau dieses Schema und liefern volle Preisdaten - einer davon verwandelte eine einzige Kategorie-URL in neunundneunzig bepreiste Zeilen. Es wäre trivial gewesen, diese Seite mit ihren Werten zu illustrieren und die Leserin schließen zu lassen. Wir haben keine davon verwendet. Ein Autoteilehändler ist ein anderer Katalog als ein Verpackungsdistributor oder ein Technologie-Reseller, und eine von dort geliehene Zahl ist kein Beleg über einen anderen; sie ist Erfindung mit angehängter Quelle. Die Seite sagt also, was unsere Läufe sagten, und wo die Antwort „wir haben es nicht“ lautet, sagt sie das. Abgerechnet wird nach gelieferten Zeilen, ein abgewiesener Versuch ist also keine Gebühr, und wenn die Kategorie wichtiger ist als der Händler, deckt der Rest des Katalogs ähnliches Feld mit echten Zeilen dahinter ab.