DoorDash Scraper - convertir un listado de reparto en filas estructuradas
DoorDash es uno de los mayores mercados de reparto de comida de Estados Unidos y, para muchísimos restaurantes, es ya el escaparate que más importa. Su página de listado responde a una pregunta concreta -qué restaurantes reparten a esta dirección- y la responde con un muro de tarjetas, cada una con un nombre, una valoración en estrellas, un número de reseñas, una ventana de entrega estimada, un coste de envío y una distancia. Ese diseño es el adecuado para alguien con hambre eligiendo la cena. Es el equivocado para cualquiera que pregunte por el mercado y no por una comida: cuántos competidores alcanzan este código postal, cómo están valorados entre sí, cuál es el coste de reparto habitual en esta calle, qué restaurantes aparecieron este mes y cuáles dejaron de estar en silencio. El DoorDash Scraper responde a eso convirtiendo el listado en una tabla: una fila por restaurante, nueve columnas, exportadas en CSV, JSON o Excel.
Lo más importante que hay que entender de estos datos es que un listado de DoorDash se genera para una dirección de entrega. Eso no es un detalle: es todo el marco. La distancia se mide desde esa dirección. La ventana de entrega se cotiza para ese trayecto. El coste varía según el restaurante y según lo lejos que esté del sitio al que pediste que repartiera. Hasta la composición de la lista depende de la dirección: muévete unos kilómetros y unos restaurantes salen mientras otros entran. La exportación tiene por tanto una columna implícita que no está en el archivo, y la disciplina que hace fiables estos datos consiste en devolverla: una dirección por archivo, o la dirección guardada junto a la ejecución. Funde dos direcciones sin esa marca y tendrás una tabla en la que la misma columna significa cosas distintas en filas distintas, sin nada en los datos que te avise.
Conviene prever dos propiedades más. La valoración del local es una Lifetime Rating en una escala de 1 a 5, y DoorDash dice sin rodeos que el cálculo exacto no se hace público y que pondera las opiniones recientes; no es la media aritmética de las reseñas que se cuentan a su lado, y no cuadrará con ellas. Usa el número de reseñas como peso de confianza y tamaño de muestra, no como denominador de una media que puedas rehacer. Y el coste de envío es la cifra que se le cotiza a un visitante sin suscripción: los miembros de DashPass no pagan coste de envío en pedidos elegibles que alcanzan un mínimo de subtotal, y esos mínimos varían a su vez por local, ciudad y hora del día. Ambos números son reales y útiles. Ambos describen a un espectador concreto en un lugar concreto en un momento concreto, y decir cuál es la diferencia entre un análisis que se sostiene y otro que, calladamente, no.
Una nota honesta sobre la evidencia que sostiene esta página. Todo lo afirmado arriba es o bien el esquema declarado de la exportación -los nueve nombres de columna, idénticos en nuestras dos ejecuciones locales- o bien una propiedad documentada de DoorDash, tomada del centro de ayuda y del material para comercios de DoorDash. Aquí no hay resultados de scraping, porque no tenemos ninguno: nuestras dos ejecuciones se hicieron contra una URL de marcador de posición en vez de contra un listado real de DoorDash y no devolvieron nada, y el servicio figura internamente como necesitado de un proxy residencial. Por eso esta página no cita recuentos de restaurantes, ni valoraciones, ni costes, ni tiempos de entrega, y no se añadirán mientras no los respalde una exportación real. Lo que la página sí describe -para qué sirve cada columna y qué pone DoorDash en esa posición- es exacto. Empieza gratis: tus primeras 500 filas no cuestan nada y no necesitan tarjeta.