Extractor de Productos de Newegg

Diecisiete columnas,
y un muro delante.

Newegg es uno de los mayores minoristas de electrónica y hardware informático en línea, y se defiende. Todas las ejecuciones que tenemos fueron rechazadas antes de llegar a un producto, así que esta página te cuenta cómo es la exportación, qué se interpone y qué medimos y qué no. Ese orden es deliberado.

500 filas gratis por única vezdespués 0,002 $ por filadiecisiete columnas por productoCSV · JSON · Excel
Cómo funciona

Una lista de URLs entra, una hoja de cálculo sale.

  1. PASO 1Inicia sesión en la plataforma.
  2. PASO 2Abre el Newegg Products Scraper.
  3. PASO 3Pega las URLs de producto de Newegg que quieras, una por línea.
  4. PASO 4Elige tu formato de salida (CSV / JSON / XLSX).
  5. PASO 5Lanza el trabajo.
  6. PASO 6Descarga los resultados: una fila por URL, diecisiete columnas, cada una con su estado.
Lee esto primero

Lo que pasó de verdad cuando lo ejecutamos.

Todos los intentos reales que tenemos fueron bloqueados

Tres de nuestras cinco ejecuciones enviaron una URL de producto genuina de Newegg. Las tres volvieron con blocked (needs residential proxy). Las otras dos usaron una dirección de marcador y devolvieron http 404. Así que no tenemos ningún dato de producto de Newegg, y esta página empieza por ahí en vez de enterrarlo bajo una lista de funciones.

El sitio responde a una petición corriente con una página antibots

Pide tú mismo esa misma URL de producto con un agente de navegador y obtienes HTTP 302 y 110 bytes: una redirección a una ruta llamada literalmente /areyouahuman. Ni página de producto, ni error: una pantalla intermedia. Es reproducible con un solo comando y es la explicación más clara de por qué fallaron las ejecuciones.

La nota de servicio publicada dice lo mismo

La entrada de Newegg en el catálogo de servicios lleva la nota «Need Residential Paid proxy». Nuestras ejecuciones, la nota del proveedor y una descarga en vivo son tres fuentes independientes y coinciden. Si se contradijeran te lo diríamos; aquí no lo hacen.

Qué significa eso para ti en la práctica

Un proxy residencial es el requisito documentado, y lo pones tú: no es algo que este servicio incluya calladamente. Si tienes uno, el esquema de abajo es lo que estarás rellenando. Si no, cuenta con que la columna de estado ponga blocked y planifica otra fuente para este minorista en concreto.

Diecisiete columnas, y algunas van en pareja

La exportación lleva price y parsed_price, sku y sku_code, image e images, url y product_url. Una de cada pareja es para leer y otra para calcular. Conviene saberlo antes de escribir el importador, y se sabe desde la cabecera aunque nuestras ejecuciones no devolvieran filas.

Una fila bloqueada llega igualmente

La última columna es status, escrita por nuestro exportador y no por el sitio. Una petición rechazada vuelve como una fila con su motivo en vez de desvanecerse, que es lo que nos permitió contarte todo lo anterior. Concilia por esa columna y un muro es visible el primer día en vez de tres semanas después.

Cómo es la exportación

Diecisiete columnas, por producto.

Leídas de la cabecera de una exportación real de este servicio, en el orden de la hoja. Ninguna de nuestras ejecuciones devolvió datos bajo esa cabecera -mira la nota debajo de la tabla-, así que cada entrada dice para qué sirve la columna y ahí se detiene.

query
La URL de Newegg que enviaste, repetida en cada fila para que una exportación con muchos productos siga siendo separable. En nuestras ejecuciones es una de solo tres columnas que llevaban algo.
sku_code
El código de artículo tal como lo imprime el catálogo. Emparejado con sku más abajo: revisa los dos antes de elegir una clave de cruce, porque en esta familia de esquemas se rellenan de forma independiente y se han observado tanto idénticos como distintos.
product_url
La página de producto canónica. Distinta de url, que indica la dirección desde la que se produjo realmente la fila; las dos difieren en cuanto un enlace enviado redirige, y en este sitio una redirección es justo lo que recibe una petición corriente.
name
El título del producto tal como lo indica el listado. En un minorista de hardware espera la configuración en el título y no en campos aparte.
description
El texto de la descripción. Espera un campo de texto libre largo y no una etiqueta corta, y dale una columna ancha o un tipo texto en tu base de datos.
parsed_price
El precio como número puro, sin símbolo ni separador de miles: el que usar para aritmética, ordenación y umbrales.
price
El precio tal como se muestra. Úsalo cuando necesites enseñar a un cliente exactamente lo que decía la página; usa parsed_price cuando necesites calcular.
currency
La moneda en la que se cotiza el precio. Léela en vez de suponerla.
availability
El estado de stock tal como se publica en el listado. Trátalo como la afirmación del minorista en el momento del scraping, no como un feed de inventario en vivo.
rating
La valoración media, cuando el listado publica una. No todos los productos llevan una, así que escribe el importador para que acepte una celda vacía en vez de fallar.
reviews
El número de reseñas, con la misma advertencia que rating. Donde ambos están presentes van juntos; una nota sin el recuento detrás no basta para ordenar.
images
Todas las imágenes que lleva el listado, en un solo campo. Sepáralo antes de guardar si necesitas una fila por recurso, y comprueba primero cuál es realmente el separador, porque en esta familia de esquemas eso ya ha dado problemas.
brand
El fabricante o la marca. El campo por el que agrupar para trabajo de surtido, cuando el listado lo publica por separado en vez de plegarlo en el nombre.
sku
La referencia de artículo. La otra mitad de la pareja de identificadores con sku_code.
url
La dirección desde la que se produjo la fila. Compárala con query para detectar redirecciones: aquí merece especialmente la pena, dado a dónde se redirige una petición no autenticada.
image
La imagen principal por separado, para que el caso habitual no requiera partir cadenas.
status
Un indicador por fila escrito por nuestro exportador, no por Newegg. A lo largo de nuestras cinco ejecuciones tomó dos valores: blocked (needs residential proxy) en las tres peticiones de producto reales y http 404 en las dos de marcador. Esta es la columna que lleva la noticia de verdad en esta página.

Diecisiete columnas por fila · CSV, JSON o Excel

Tenemos cinco ejecuciones de este servicio y ni una devolvió un producto de Newegg. Tres enviaron una URL de producto genuina y volvieron con blocked (needs residential proxy); dos enviaron una dirección de marcador y volvieron con http 404. Los diecisiete nombres de columna de arriba son por tanto reales -son la cabecera que llevan esas exportaciones, y una cabecera es real haya o no algo debajo- mientras que los valores nos son completamente desconocidos, así que no se describe ninguno en esta página. Dos cosas corroboran el bloqueo en vez de dejarlo en nuestra palabra. El propio catálogo de servicios del proveedor adjunta a Newegg la nota «Need Residential Paid proxy». Y pedir la misma URL de producto directamente, con un agente de navegador, devuelve HTTP 302 y 110 bytes redirigiendo a una ruta llamada /areyouahuman: una pantalla antibots en vez de una página. Una cosa más que deliberadamente no hicimos: CDW comparte exactamente este esquema de diecisiete columnas y su exportación sí lleva precios reales. Usar los valores de CDW para ilustrar las columnas de Newegg sería una suposición vestida de medición, así que esta página no lo hace.

Para qué sirve

Por qué merece la pena leer un catálogo de hardware.

Seguimiento de precios

Seguir un componente, no un momento

Los precios del hardware se mueven por suministro y no por temporadas, y una sola lectura no dice casi nada. Guarda parsed_price, currency y la fecha de ejecución a lo largo de una programación y la serie es el entregable. Sujeto, en este minorista, a conseguir pasar.

Precios · Monitorización
Comparación minorista

Poner un precio de consumo junto a uno de empresa

Newegg vende al público; nuestro scraper de CDW lee el mismo hardware con precio para compradores profesionales en el mismo esquema. La pareja es lo interesante: un importador, dos audiencias, las mismas referencias.

Compras · Benchmarking
Seguimiento de surtido

Vigilar qué lista un minorista

Lanza un conjunto de URLs de producto de forma programada y guarda name, brand y ambos identificadores con la fecha de ejecución. Los productos se renombran, se redescriben y se retiran más a menudo de lo que nadie anuncia.

Investigación de categoría · Surtido
Conciliación

Cruzar piezas entre catálogos

Dos columnas de identificador es el patrón para el que existe este esquema. Donde un listado publica una referencia de fabricante además de la propia, ese es el valor que sobrevive al salto a otro minorista, así que revisa las dos antes de elegir clave de cruce.

Compras · Registros
Precios

Paga solo por lo que realmente usas.

Plan gratuito

Las primeras 500 filas son gratis

Por única vez, al registrarte. Sin tarjeta y sin nada que cancelar después.

Por única vez, al registrarte
Tarifa

después 0,002 $ por fila

Se factura por filas realmente devueltas. Una fila que vuelve con un status distinto de uno correcto no es una fila de datos de producto, y no se te cobra como tal, algo que en este minorista en concreto conviene saber.

Facturado por filas devueltas
Sin suscripción

Nada recurrente

Los créditos no caducan en un ciclo mensual. Lanza un barrido en marzo y nada más hasta septiembre si el trabajo tiene esa forma.

Sin caducidad mensual
10 % de descuento en tu primera ejecución de pago.Usa el código LIVESCRAPER10 al pagar.
Registrarse
Prueba estos en su lugar

Catálogos que sí devolvieron filas.

La parte legal

¿Es legal hacer scraping de Newegg?

Los hechos de producto en un listado de acceso público son información competitiva corriente. La pregunta que de verdad importa en este sitio no es si puedes leerlos sino si consigues hacerlo, y preferimos ser francos con eso.

Un precio, un nombre de producto, una marca y un estado de stock son hechos sobre bienes puestos a la venta. Leerlos de una página que se sirve a cualquier visitante es la misma actividad que un comprador hace a mano, a una velocidad útil. Nada en las diecisiete columnas describe a una persona: no hay nombre, ni correo, ni teléfono, ni cuenta, así que las cuestiones de protección de datos que marcan nuestros servicios sobre personas no se plantean aquí.

El asunto honesto es el acceso, no el permiso. Newegg opera una capa antibots que respondió a todas nuestras peticiones, y que responde a una descarga directa reciente con una redirección a una pantalla intermedia en vez de a una página. No la derrotamos. No resolvemos desafíos, no nos hacemos pasar por un comprador con sesión iniciada y no presentamos este servicio como una forma de rodear una protección que el sitio ha puesto deliberadamente: lo que hacemos es informar del rechazo en la columna de estado para que puedas verlo. La vía documentada es un proxy residencial, y lo aportas tú. Si estás sopesando si hacerlo, la pregunta relevante es tu propio acuerdo con Newegg y la opinión de tu asesoría, no la nuestra.

Nuestras condiciones son las mismas que en cualquier otro servicio de aquí. Solo páginas de acceso público, nada detrás de un inicio de sesión, sin rastreadores de terceros en la capa de datos, y las exportaciones se eliminan automáticamente a los 30 días. Tus primeras 500 filas son gratis y no necesitan tarjeta.

livescraper.app · qué condiciona una ejecución
Una URL de producto por fila
Hay una pantalla antibots delante
Un proxy residencial es el requisito documentado
Solo acceso anónimo: no resolvemos desafíos
Las exportaciones se eliminan a los 30 días
Tres fuentes coinciden en el obstáculo: nuestras ejecuciones, la nota de servicio publicada y una descarga en vivo que redirige a una página llamada areyouahuman.
Preguntas frecuentes

Lo que la gente pregunta antes de registrarse.

¿Este servicio devolvió realmente algún dato de Newegg?+
No. Tenemos cinco ejecuciones. Tres enviaron una URL de producto real de Newegg y devolvieron blocked (needs residential proxy); dos enviaron una dirección de marcador y devolvieron http 404. No hay valores de Newegg en esta página porque no tenemos ninguno, y preferimos decírtelo en la primera pantalla antes que después de que te registres.
¿Por qué está bloqueado?+
Newegg opera una capa antibots. Pedir una URL de producto directamente con un agente de navegador devuelve HTTP 302 y 110 bytes, redirigiendo a una ruta llamada /areyouahuman: una pantalla intermedia en vez de una página de producto. La nota de servicio publicada para Newegg dice lo mismo con otras palabras: «Need Residential Paid proxy». Nuestras ejecuciones son la tercera fuente que lo dice.
¿Funcionará si aporto un proxy residencial?+
Ese es el requisito documentado y la vía a la que apunta la nota de servicio. No vamos a prometer un resultado que no hemos medido -todas las ejecuciones que tenemos fueron rechazadas-, así que trátalo como el camino conocido y no como una garantía, y prueba con un lote pequeño antes de programar nada.
¿Resolvéis el desafío antibots?+
No. No resolvemos desafíos ni nos hacemos pasar por un comprador con sesión iniciada. Cuando el sitio rechaza, la fila vuelve con blocked como estado, que es como te enteras el primer día en vez de descubrir una columna vacía tres semanas después.
¿Qué columnas contiene la exportación?+
Diecisiete, en este orden: query, sku_code, product_url, name, description, parsed_price, price, currency, availability, rating, reviews, images, brand, sku, url, image y status. Una fila por URL de producto que envíes. Esos nombres vienen de la cabecera de una exportación real, y una cabecera es real haya o no algo debajo.
Otras páginas comparten este esquema. ¿No podéis enseñarme sus valores?+
Podríamos, y no vamos a hacerlo. Nuestro scraper de CDW usa exactamente este esquema de diecisiete columnas y sus ejecuciones sí devolvieron precios reales, pero son los números de CDW, de las páginas de CDW. Usarlos para ilustrar lo que devuelve Newegg sería una suposición vestida de medición.
¿Qué debería usar en su lugar?+
Si quieres precios de hardware que nuestras ejecuciones produjeran de verdad, el CDW Products Scraper lee el mismo mercado en el mismo esquema y volvió con precios, y allí una sola URL de categoría devuelve una fila por producto en ella. Es un distribuidor para empresas y no un minorista de consumo, así que los números responden a una pregunta ligeramente distinta.
¿Cuánto cuesta?+
Tus primeras 500 filas son gratis, por única vez y sin tarjeta. Después son 0,002 $ por fila, facturadas por filas realmente devueltas, y una fila que vuelve bloqueada no es una fila de datos de producto, así que no se cobra como tal.
¿En qué formatos puedo exportar?+
CSV, JSON o Excel. Las diecisiete columnas y su orden son los mismos en los tres.

Conoce el muro antes de chocarte.

Diecisiete columnas documentadas desde una cabecera de exportación real, un obstáculo documentado desde tres fuentes independientes, y ninguna fila inventada en ninguna parte. Tus primeras 500 filas son gratis, después 0,002 $ cada una.

Se activa al instante · sin tarjeta

Hacer scraping de datos de producto de Newegg

Newegg es uno de los mayores minoristas en línea de hardware informático, componentes y electrónica de consumo, lo que hace que su catálogo sea algo obvio de querer en una hoja de cálculo: los precios de los componentes se mueven por suministro y no por temporadas, y una tabla de ellos a lo largo del tiempo vale más que cualquier lectura suelta. El obstáculo no es que los hechos sean privados. Es que el sitio se defiende, y esta página va a empezar por ahí en vez de describir un producto que no entregó.

Todas las ejecuciones que tenemos fueron rechazadas. Tres de las cinco enviaron una URL de producto genuina de Newegg y las tres devolvieron blocked (needs residential proxy); las otras dos usaron una dirección de marcador y devolvieron http 404. Eso no es lo mismo que no haberlo probado: la dirección se intentó tres veces en una sesión y fue rechazada cada vez. Otras dos fuentes dicen lo mismo de forma independiente. La nota de servicio publicada adjunta a Newegg dice «Need Residential Paid proxy». Y pedir esa misma URL de producto directamente, con un agente de navegador corriente, devuelve HTTP 302 y 110 bytes redirigiendo a una ruta llamada literalmente /areyouahuman: una pantalla antibots en vez de una página de producto, reproducible con un solo comando. Nuestras ejecuciones, la nota del proveedor y una descarga en vivo coinciden; cuando las fuentes se contradicen lo decimos, y aquí no lo hacen.

Lo que sí establecen las ejecuciones es la forma de la exportación. Diecisiete columnas por URL de producto -query, sku_code, product_url, name, description, parsed_price, price, currency, availability, rating, reviews, images, brand, sku, url, image y status- leídas de la cabecera que llevan esas exportaciones, que es una cabecera real haya o no algo debajo. Cuatro de esas columnas son parejas: precio como se muestra frente a precio como número, dos campos de identificador, imagen principal frente a todas las imágenes, URL pedida frente a URL canónica. Saber qué mitad usar antes de escribir el importador es la diferencia entre una carga limpia y una reescritura, y se sabe solo desde la cabecera.

Una cosa que deliberadamente no hicimos. Nuestro scraper de CDW usa exactamente este esquema y sus ejecuciones sí volvieron con precios reales, así que habría sido fácil ilustrar estas columnas con aquellos valores y dejar que el parecido de familia hiciera el resto. Son los números de CDW de las páginas de CDW, y presentarlos aquí sería una suposición vestida de medición. Por tanto no encontrarás precios, referencias ni valoraciones de ejemplo en ninguna parte de esta página. Sobre el acceso: no resolvemos desafíos antibots, no nos hacemos pasar por un comprador con sesión iniciada y no vendemos esto como una forma de rodear una protección que el minorista ha levantado deliberadamente; una petición rechazada vuelve como una fila con su motivo, que es como te enteras el primer día. Un proxy residencial es la vía documentada y lo aportas tú. Si quieres precios de hardware que nuestras ejecuciones produjeran de verdad, el CDW Products Scraper lee el mismo mercado en el mismo esquema, y allí una sola URL de categoría devuelve una fila por cada producto en ella. Solo páginas de acceso público, sin rastreadores de terceros en la capa de datos, y las exportaciones se eliminan automáticamente a los 30 días. Tus primeras 500 filas son gratis y no necesitan tarjeta.