Scraper de Productos de Tesco

Páginas de producto de Tesco,
como quince columnas.

Pega una URL de producto de alimentación de Tesco, o una URL de categoría o búsqueda, y los productos vuelven como filas: nombre, precio y moneda, disponibilidad, marca, las columnas de identificador, valoración y reseñas, una imagen, un enlace y una descripción.

500 filas gratis, una sola vez0,002 $ por fila después15 columnasCSV · XLSX · JSON
Cómo funciona

Cinco pasos,
y ninguna configuración.

Una entrada y un control. Aquí no hay proxy que configurar, así que todo el trabajo es una lista de enlaces y un número.

  1. PASO 1Inicia sesión en la plataforma.
  2. PASO 2Abre el Scraper de Productos de Tesco.
  3. PASO 3Pega URLs de producto de Tesco o URLs de categoría y búsqueda, una por línea - o sube un archivo CSV, XLSX o TXT.
  4. PASO 4Fija un límite por consulta, o ponlo a cero para llevártelo todo, y haz clic en Get Data.
  5. PASO 5Descarga el resultado como CSV, XLSX o JSON.

El límite es por consulta: cinco URLs de categoría con un límite de doscientos son doscientos productos de cada una, no doscientos en total.

Por qué lo usan los equipos

Un catálogo que puedes ordenar,
no una cuadrícula que hay que recorrer.

Un enlace de producto o una categoría entera

Una línea puede ser una página de producto suelta o una URL de categoría o búsqueda, y una categoría vuelve desplegada en sus productos, una fila cada uno. Así es como una página de navegación se convierte en algo que puedes ordenar por precio o agrupar por marca.

Sin proxy necesario

Algunos comercios de esta tubería compartida necesitan una salida residencial propia: la herramienta señala a Lowes, Grainger, Zalando y Fastenal. Tesco no es uno de ellos. La ejecución va por nuestro pool y no hay nada que configurar.

Columnas de identificador, mantenidas aparte

sku, mpn y gtin llegan como columnas propias en vez de enterradas en un título, y currency va al lado de price en vez de dentro. Eso es lo que hace que una exportación se pueda cruzar con un catálogo que no es el de Tesco, allí donde la página declare esos campos.

Lo que esta página puede y no puede decirte

Los nombres están confirmados.
Los contenidos no.

Conviene decirlo con claridad, porque cambia cómo deberías leer el diccionario de abajo.

Los quince nombres de columna son sólidos: están confirmados por partida doble, por el array de columnas publicado para este servicio y por la fila de cabecera de todos los libros que tenemos de la tubería compartida que hay detrás - idéntica en el poblado y en los vacíos por igual. Construye un esquema alrededor de esos nombres con confianza.

Lo que no podemos hacer es decirte qué pone Tesco en ellas, porque nunca hemos ejecutado esto contra Tesco. Ninguna de las exportaciones que tenemos es una ejecución de Tesco. Casi todas volvieron con una cabecera y ninguna fila, y la única poblada es otro comercio por completo. En vez de disimularlo, esta página no imprime valores de ejemplo ni formatos: sin una ejecución de Tesco, estaríamos inventándolos.

La buena noticia es lo barato que resulta resolverlo. Cuáles de las trece columnas declaradas publica Tesco realmente es una pregunta que una sola ejecución pequeña responde de forma definitiva, y las primeras 500 filas no cuestan nada - así que apúntala a una única categoría, mira lo que volvió y sabrás más sobre esta exportación de lo que ninguna página podría decirte honestamente de antemano.

Diccionario de datos

Quince columnas,
y un techo honesto.

Los nombres son exactos y están doblemente confirmados. Las descripciones dicen para qué sirve cada columna, no qué contendrá, porque eso lo decide el minorista y no nosotros, y la nota de abajo explica por qué.

query
La URL que enviaste para esta fila: la página de producto, categoría o búsqueda de la que salió. La escribe el scraper, así que está en todas las filas.
service
De qué minorista salió esta fila. Este scraper comparte una tubería con varios otros servicios de producto, y el que elegiste queda estampado en cada fila - útil si mantienes más de un minorista en la misma tabla.
name
El nombre del producto tal y como lo declara la página.
price
El precio que declara la página.
currency
La moneda de ese precio, como columna aparte - así no tienes que extraer un símbolo del campo de precio.
availability
El estado de stock que declara la página.
brand
La marca que declara la página.
sku
El código de artículo propio del minorista.
mpn
El número de pieza del fabricante. Junto con gtin, es lo que hace que una exportación se pueda cruzar con un catálogo que no es el de Tesco.
gtin
El número global de artículo comercial: el identificador del código de barras.
rating
La valoración del producto, si la página publica una. Aquí no se indica ninguna escala; no hemos visto ningún valor.
reviews
El número de reseñas. Un recuento, no el texto - en esta exportación no hay cuerpo de reseña.
image
La imagen de producto que declara la página.
url
El enlace al producto.
description
La descripción del producto que declara la página.

Dos cosas sobre las pruebas detrás de esta página. Primero, el mecanismo: los productos se leen del JSON-LD que una página publica sobre sí misma, los datos estructurados que los comercios incrustan para los buscadores. Eso fija un techo que esta página no va a fingir superar. Toda columna posterior a service existe solo si Tesco declara ese campo, así que un hueco significa no publicado, no ejecución fallida. Segundo, la laguna: nunca hemos ejecutado esto contra Tesco. Tenemos cuarenta y cinco exportaciones de la tubería compartida que hay detrás de este servicio y ninguna es una ejecución de Tesco: cuarenta y cuatro volvieron vacías y la única poblada es otro comercio. Esa exportación vale un dato honesto sobre la herramienta y no sobre Tesco: query y service se llenaron en todas las filas, porque el scraper las escribe él mismo, y seis de las quince estaban vacías en todas y cada una. Cuenta también aquí con huecos, cuenta con que caigan en otro sitio porque otro comercio publica datos estructurados distintos, y deja que tu primera ejecución gratuita te diga cuáles. Por eso también esta página no imprime valores de ejemplo ni formatos: sin una ejecución de Tesco, estaríamos inventándolos.

Controles de la ejecución

Dos entradas,
y ese es todo el formulario.

Una lista de URLs y un límite. Sin orden, sin filtro, sin campo de proxy: en este comercio no hay nada más que fijar.

https://www.tesco.com/groceries/en-GB/products/305096546 Una URL de producto, o de categoría / búsqueda Una por línea Subida CSV · XLSX · TXT Límite por consulta, o 0 para todo Una fila por producto Sin proxy residencial Leído del JSON-LD de la página
De dónde salen los campos

La página lo declara,
nosotros lo reportamos.

Este scraper lee los datos estructurados que una página de producto publica sobre sí misma: el bloque JSON-LD que los minoristas incrustan para que los buscadores puedan mostrar un precio y un estado de stock. Por eso las columnas se leen como se leen: sku, mpn, gtin, brand, availability y currency son el vocabulario estándar para describir un producto, no nombres que nos hayamos inventado.

La consecuencia práctica es la que conviene tener en cuenta. Una columna es tan buena como el marcado del propio minorista. Si un campo falta en los datos estructurados de la página, vuelve vacío, y repetir la ejecución no cambia eso: no es un fallo, es una ausencia. En la única exportación con datos que tenemos de esta herramienta compartida, seis de las quince columnas estaban vacías en todas las filas.

Si necesitas algo que el marcado no lleva, ese es otro trabajo: el Scraper Universal con IA lee la página en sí y devuelve los atributos que nombres, en lugar de solo lo que se declaró para los buscadores.

livescraper.app · el techo
Leído del JSON-LD de la página
query y service: los escribimos nosotros
Las otras trece: las declara la página
Vacío = no publicado, no fallido!
Comprueba los huecos en tu primera ejecución
Los datos estructurados los decide cada minorista, y no todos deciden igual.
Entregar la lista

Las subidas se suman
y no eliminan duplicados.

Un archivo subido no vacía la caja: las líneas se añaden a lo que ya hubieras escrito, y los duplicados no se eliminan. Sube el mismo archivo dos veces y esas URL se pedirán dos veces, y se facturarán dos veces. Esto es propio de esta tubería: algunos de nuestros otros scrapers sí deduplican al subir y este no, así que no traigas la costumbre de allí.

Para un CSV o un TXT se toma la línea entera como una URL, así que una hoja de cálculo con columnas extra no es lo que quieres aquí. Solo un XLSX se lee por columnas, y ahí toma la columna A.

El selector lista Parquet junto a CSV, XLSX y TXT, pero en realidad no puede leer uno en el navegador y te lo dirá - usa cualquiera de los otros tres.

livescraper.app · la subida
CSV · XLSX · TXT
Los duplicados NO se eliminan!
CSV y TXT: la línea entera
XLSX: columna A
Añadido a lo que escribiste
Revisa el cuadro antes de ejecutar: una lista duplicada es una factura duplicada.
Flujos de trabajo habituales

Tres trabajos que la gente
ejecuta más a menudo aquí.

Algunos ejemplos de lo que vale un catálogo de alimentación una vez que es una tabla.

Surtido

Ver una categoría como lista y no como cuadrícula

Dale una página de categoría y obtienes cada producto de ella como fila, con la marca y las columnas de identificador junto al nombre. Ordenar una página de navegación por algo que no sea lo que ofrece el sitio es justamente el objetivo.

Merchandising · Investigación
Comparación

Pon un comercio junto a los otros que sigues

Como service va estampado en cada fila, una misma tabla puede tener Tesco junto a los otros comercios de esta tubería y seguir separándose limpiamente. Donde mpn o gtin estén declarados, el mismo artículo se puede emparejar entre proveedores.

Compras · Gestión de categorías
Seguimiento

Volver a ejecutar una categoría y compararla

La misma URL de categoría de forma programada te da dos archivos comparables. Lo que apareció, lo que desapareció y lo que cambió es un diff en vez de una tarde de clics - y sku es la clave con la que compararlos donde se publique.

Análisis · Informes
Precios

Paga solo por los productos
que realmente extraes.

Sin suscripción, sin mínimo, sin factura recurrente. Tus primeras 500 filas corren de nuestra cuenta y después pagas por uso, a la misma tarifa plana que cualquier otro scraper de aquí.

Plan gratuito

500 filas gratis - 0 $

En cada cuenta nueva, una sola vez. Sin tarjeta de crédito. Límites por consulta, subida de archivos y todos los formatos de exportación incluidos - y en este comercio, tampoco hay proxy que pagar.

0 $ para siempre
Pago por uso

0,002 $ por fila, tras el plan gratuito

La misma tarifa plana que cualquier otro scraper de la plataforma. El estimador previo muestra el número de filas y el coste en créditos antes de arrancar - aquí merece un vistazo, porque el límite es por consulta y una lista de URL de categoría multiplica.

El más popular
Volumen

A medida · gran volumen

Precio por volumen, workers dedicados y un SLA para seguir un catálogo de forma programada. Cuéntanos tus números y te pasamos presupuesto.

Habla con nosotros
10 % de descuento en tu primera ejecución de pago.Usa el código LIVESCRAPER10 al pagar.
Regístrate
Combina bien con

La misma tubería,
y la manera de ir más allá.

Dos hermanos sobre la misma herramienta compartida, y uno para cuando los datos estructurados no llevan lo que necesitas.

La parte legal

¿Es legal scrapear
Tesco?

Respuesta corta: esto son datos públicos de catálogo sin datos personales dentro - y los datos estructurados se publican, de entrada, para que los lean máquinas.

Todo lo que hay en estas quince columnas se le muestra a cualquier visitante en una página de producto pública de Tesco, con sesión iniciada o sin ella. No se usa ningún inicio de sesión, no se cruza ningún muro de pago y no se toca ninguna cuenta, y la ejecución va por nuestro pool de proxies en vez de por tu propia IP. Lo que se lee en concreto es el bloque JSON-LD: datos estructurados que un comercio incrusta precisamente para que lectores automatizados puedan recoger el nombre, el precio y la disponibilidad.

En esta exportación no se nombra a ninguna persona. No hay columna de cliente, ni de quien reseña, ni de vendedor - reviews es un recuento, no el texto de las reseñas, así que ni siquiera vuelve el cuerpo de una reseña. Son productos y precios, lo que la sitúa en el extremo más leve en cuanto a protección de datos.

Los propios términos de Tesco rigen la recopilación automatizada desde su web, así que léelos antes de escalar en vez de fiarte de que las páginas sean públicas. Y si republicas descripciones de producto o imágenes, recuerda que son textos y fotografías de otros: recopilarlas para analizar es una cosa y publicarlas es otra. No usamos rastreadores de terceros en la capa de datos, y tus exportaciones se autoeliminan a los 30 días.

livescraper.app · principios
Solo páginas de producto públicas
Sin inicios de sesión, sin tocar cuentas
Datos estructurados, publicados para máquinas
Productos y precios: no se nombra a nadie
Las exportaciones se borran solas (30 días)
Revisa los propios términos de Tesco antes de escalar.
Preguntas frecuentes

Lo que la gente pregunta
antes de registrarse.

Las preguntas que más nos hacen. ¿Algo más? Habla con nosotros: las respuestas las escriben personas, no bots.

¿Cómo scrapeo productos de Tesco?+
Con el Scraper de Productos de Tesco: inicia sesión en la plataforma, abre el Scraper de Productos de Tesco, pega URLs de producto de Tesco o URLs de categoría y búsqueda una por línea (o sube un archivo CSV, XLSX o TXT), fija un límite por consulta o ponlo a cero para llevarte todo, luego haz clic en Get Data y descarga el resultado como CSV, XLSX o JSON.
¿Necesito un proxy residencial para este?+
No. La ejecución va por nuestro pool compartido y no hay nada que configurar. Merece la pena decirlo porque no vale para todos los comercios de esta tubería: la herramienta señala a Lowes, Grainger, Zalando y Fastenal como necesitados de una salida residencial propia. Tesco no está entre ellos.
¿Qué puedo pegar como entrada?+
Una URL de producto de Tesco, o una URL de categoría o búsqueda: las dos funcionan, una por línea. El ejemplo propio de la plataforma para este servicio es una página de producto de alimentación, https://www.tesco.com/groceries/en-GB/products/305096546. Una URL de categoría devuelve los productos que hay en ella, una fila cada uno, hasta el límite que fijes.
¿Qué columnas voy a obtener?+
Quince, en este orden: query, service, name, price, currency, availability, brand, sku, mpn, gtin, rating, reviews, image, url y description. Esos nombres están confirmados por partida doble: por el array de columnas publicado para este servicio y por la fila de cabecera de todos los libros que tenemos de la tubería compartida que hay detrás. El JSON añade un decimosexto campo, position; el CSV y el XLSX se quedan en quince.
¿Por qué esta página no muestra valores de ejemplo?+
Porque nunca hemos ejecutado esto contra Tesco, y preferimos decirlo a inventarlos. De las cuarenta y cinco exportaciones que tenemos de la tubería compartida que hay detrás de este servicio, ninguna es una ejecución de Tesco: cuarenta y cuatro volvieron con una cabecera y ninguna fila, y la única poblada es otro comercio. Los nombres de columna son sólidos; los contenidos de las celdas no son algo que podamos describir honestamente todavía.
¿Por qué puede volver una columna en blanco?+
Porque la página nunca declaró ese campo. Los productos se leen del JSON-LD que una página publica sobre sí misma, así que cada columna después de service existe solo si el comercio la puso en sus datos estructurados: un blanco significa no publicado y no ejecución fallida, y volver a ejecutar no lo cambia. En la única exportación poblada que tenemos de esta herramienta compartida, seis de las quince columnas estaban en blanco en todas las filas.
¿Subir un archivo reemplaza lo que he escrito?+
No: se añade a ello, y no elimina duplicados. Sube el mismo archivo dos veces y esas URL se pedirán dos veces y se facturarán dos veces, así que revisa la caja antes de ejecutar. En CSV y TXT se toma la línea entera como una URL; solo el XLSX se lee por columnas, y ahí toma la columna A. Parquet aparece en el selector pero no se puede leer en el navegador.
¿Cuánto cuesta?+
Las primeras 500 filas son gratis y de una sola vez, sin tarjeta de crédito. Después son 0,002 $ por fila - la misma tarifa plana que cualquier otro scraper de la plataforma. El estimador muestra el coste de una ejecución antes de que arranque, algo que aquí merece un vistazo porque el límite es por consulta y una lista de URL de categoría multiplica.

Convierte una página de categoría
en una tabla que puedes ordenar.

Tus primeras 500 filas son gratis: sin tarjeta, sin suscripción. Después son 0,002 $ por fila, tarifa plana.

Se activa al instante · sin tarjeta

Scrapear páginas de producto de Tesco a filas

El Scraper de Productos de Tesco convierte páginas de producto y de categoría de tesco.com en filas. Pega una URL de producto de alimentación - el ejemplo propio de la plataforma es tesco.com/groceries/en-GB/products/305096546 - o una URL de categoría o búsqueda, una por línea, o sube un archivo CSV, XLSX o TXT, fija un límite por consulta, y cada producto vuelve como un registro con la consulta de la que salió, el servicio que lo produjo, el nombre, precio y moneda, disponibilidad, marca, sku, mpn y gtin, una valoración y número de reseñas, una imagen, un enlace y una descripción. Quince columnas en el archivo y dieciséis en el JSON, una fila por producto. A diferencia de algunos comercios de esta tubería compartida - la herramienta señala a Lowes, Grainger, Zalando y Fastenal - Tesco no necesita un proxy residencial propio, así que no hay nada que configurar más allá de la lista y el límite.

Dos cosas conviene entenderlas antes de construir sobre esta exportación, y ambas se reducen a de dónde salen los datos. Los productos se leen del JSON-LD que una página publica sobre sí misma: los datos estructurados que los comercios incrustan para que los buscadores puedan mostrar un precio y un estado de stock. Por eso las columnas llevan los nombres que llevan: sku, mpn, gtin, brand, availability y currency son el vocabulario estándar para describir un producto. También pone un techo: cada columna después de service existe solo si el comercio declaró ese campo, así que una celda en blanco significa no publicado y no ejecución fallida, y volver a ejecutar no la llenará.

Lo segundo es que esta página no imprime valores de ejemplo, porque nunca la hemos ejecutado contra Tesco. De las cuarenta y cinco exportaciones que tenemos de la tubería compartida que hay detrás de este servicio, ninguna es una ejecución de Tesco: cuarenta y cuatro devolvieron una cabecera y ninguna fila, y la única poblada es otro comercio. Esa exportación vale exactamente una observación honesta, y es sobre la herramienta y no sobre Tesco: query y service se llenaron en todas las filas porque el scraper las escribe él mismo, y seis de las quince columnas estaban en blanco en todas las filas. Cuenta también aquí con huecos, cuenta con que caigan en otro sitio porque otro comercio publica datos estructurados distintos, y deja que una pequeña ejecución gratuita te diga cuáles: es una pregunta que 500 filas gratis resuelven para siempre.

En lo legal, esta es de las exportaciones más ligeras de nuestro catálogo. Todo lo recogido se le muestra a cualquier visitante en una página de producto pública, no hay inicio de sesión ni muro de pago de por medio, y no se nombra a ninguna persona en ninguna de las quince columnas: reviews es un recuento y no texto de reseñas, así que ni siquiera vuelve un cuerpo de reseña. Son productos y precios. Los propios términos de Tesco siguen rigiendo la recopilación automatizada desde su web, así que léelos antes de escalar, y recuerda que las descripciones de producto y las imágenes son textos y fotografías de otros si piensas republicarlos. Empieza gratis: tus primeras 500 filas no cuestan nada y no necesitan tarjeta, y después son 0,002 $ por fila, tarifa plana.