Scrapear páginas de producto de Tesco a filas
El Scraper de Productos de Tesco convierte páginas de producto y de categoría de tesco.com en filas. Pega una URL de producto de alimentación - el ejemplo propio de la plataforma es tesco.com/groceries/en-GB/products/305096546 - o una URL de categoría o búsqueda, una por línea, o sube un archivo CSV, XLSX o TXT, fija un límite por consulta, y cada producto vuelve como un registro con la consulta de la que salió, el servicio que lo produjo, el nombre, precio y moneda, disponibilidad, marca, sku, mpn y gtin, una valoración y número de reseñas, una imagen, un enlace y una descripción. Quince columnas en el archivo y dieciséis en el JSON, una fila por producto. A diferencia de algunos comercios de esta tubería compartida - la herramienta señala a Lowes, Grainger, Zalando y Fastenal - Tesco no necesita un proxy residencial propio, así que no hay nada que configurar más allá de la lista y el límite.
Dos cosas conviene entenderlas antes de construir sobre esta exportación, y ambas se reducen a de dónde salen los datos. Los productos se leen del JSON-LD que una página publica sobre sí misma: los datos estructurados que los comercios incrustan para que los buscadores puedan mostrar un precio y un estado de stock. Por eso las columnas llevan los nombres que llevan: sku, mpn, gtin, brand, availability y currency son el vocabulario estándar para describir un producto. También pone un techo: cada columna después de service existe solo si el comercio declaró ese campo, así que una celda en blanco significa no publicado y no ejecución fallida, y volver a ejecutar no la llenará.
Lo segundo es que esta página no imprime valores de ejemplo, porque nunca la hemos ejecutado contra Tesco. De las cuarenta y cinco exportaciones que tenemos de la tubería compartida que hay detrás de este servicio, ninguna es una ejecución de Tesco: cuarenta y cuatro devolvieron una cabecera y ninguna fila, y la única poblada es otro comercio. Esa exportación vale exactamente una observación honesta, y es sobre la herramienta y no sobre Tesco: query y service se llenaron en todas las filas porque el scraper las escribe él mismo, y seis de las quince columnas estaban en blanco en todas las filas. Cuenta también aquí con huecos, cuenta con que caigan en otro sitio porque otro comercio publica datos estructurados distintos, y deja que una pequeña ejecución gratuita te diga cuáles: es una pregunta que 500 filas gratis resuelven para siempre.
En lo legal, esta es de las exportaciones más ligeras de nuestro catálogo. Todo lo recogido se le muestra a cualquier visitante en una página de producto pública, no hay inicio de sesión ni muro de pago de por medio, y no se nombra a ninguna persona en ninguna de las quince columnas: reviews es un recuento y no texto de reseñas, así que ni siquiera vuelve un cuerpo de reseña. Son productos y precios. Los propios términos de Tesco siguen rigiendo la recopilación automatizada desde su web, así que léelos antes de escalar, y recuerda que las descripciones de producto y las imágenes son textos y fotografías de otros si piensas republicarlos. Empieza gratis: tus primeras 500 filas no cuestan nada y no necesitan tarjeta, y después son 0,002 $ por fila, tarifa plana.