Hacer scraping de datos de eventos de Eventbrite
El Eventbrite Scraper toma un evento y lo devuelve como una fila de diez columnas: query, name, start, end, venue, address, price, currency, organizer y url. Puedes enviar la URL completa del evento o el id numérico pelado: ambos aparecieron en nuestras ejecuciones y ambos funcionaron, lo que importa si ya guardas ids en una base de datos y de otro modo tendrías que reconstruir URLs a partir de ellos.
Hay cuatro comportamientos que conviene conocer antes de construir sobre esto, todos observados y no supuestos. Las horas vuelven como ISO 8601 con desplazamiento UTC en lugar de una Z final, así que analiza el desplazamiento en vez de tratar el valor como UTC. Los eventos recurrentes devuelven su próxima ocurrencia: hicimos scraping de un evento el 30 de junio y otra vez quince días después y el inicio se movió del 4 al 11 de julio sin que cambiara nada más, así que un calendario construido sobre una primera respuesta cacheada se desviará. price y currency son opcionales en la práctica -en ese mismo evento, dos de tres ejecuciones con datos devolvieron ambos vacíos y una devolvió 0.0 y USD- y price es una cadena y no un número. Y una ejecución puede no devolver nada: una de nuestras cuatro volvió sin filas y sin columnas, y por eso se concilia con la lista de entrada en vez de suponer una fila por envío.
La dirección merece una línea más. Llega como una única cadena que repite la ciudad y el estado, literalmente 447 Edgewood Avenue Southeast, Atlanta, GA 30312, Atlanta, GA, US, así que separa por comas y deduplica antes de geocodificar. venue y organizer son columnas separadas con valores realmente distintos -la sala y el promotor- y esa separación es lo que hace que la exportación sirva para trabajo de alianzas y no solo para listar.
Estamos siendo deliberadamente cuidadosos con lo que esta página no dice. Las tres ejecuciones con datos que hay detrás son del mismo evento, así que aquí no hay nada sobre cuántos eventos tiene Eventbrite, cuánto cuestan normalmente, qué categorías cubre o con qué frecuencia se rellena cada campo en la plataforma. Un evento no es una muestra, y citar una tasa a partir de él sería inventar una medición. En lo legal, una ficha de evento se publica para ser encontrada y ninguna de las diez columnas describe a un asistente, pero organizer es a veces el nombre propio de una persona, que es dato personal aunque se publicara voluntariamente, así que trata en consecuencia cualquier lista de prospección construida a partir de él. Solo páginas de acceso público, sin rastreadores de terceros en la capa de datos, y las exportaciones se eliminan automáticamente a los 30 días. Tus primeras 500 filas son gratis y no necesitan tarjeta.