Extractor de Empleos de Glassdoor - una búsqueda como filas ordenadas y exportables
La búsqueda de empleo de Glassdoor está hecha para navegar: haces scroll, haces clic, y el orden que determinó lo que viste desaparece en cuanto abandonas la página. El Extractor de Empleos de Glassdoor toma en cambio una URL de búsqueda y devuelve sus resultados como tabla - una fila por resultado, con el puesto, la empresa, la ubicación, el salario anunciado con su fuente, el enlace a la oferta, un extracto de la descripción, el logotipo de la empresa y la posición que ocupó el resultado en el ranking. Construye la búsqueda en Glassdoor con los filtros que quieras, envía la URL y llévate los resultados como CSV, JSON o Excel.
Esta página es más cauta que las demás de este sitio, y la razón merece ir por delante. Nuestra evidencia es una única ejecución con datos de 100 filas procedente de una búsqueda; otras cinco ejecuciones no devolvieron nada en absoluto. Los doce nombres de columna son firmes - la cabecera de la hoja coincide exactamente con las claves del JSON y es idéntica en las seis ejecuciones - pero cada cifra a su lado describe esa única búsqueda y no el servicio. Tampoco hay referencia publicada para este endpoint: Glassdoor no aparece en ninguna parte de la documentación de la API, así que esta página no cita límite de lote, ni configuración de idioma o región, ni criterio de orden, porque no existe fuente para ellos. Donde otras páginas de aquí pueden contarte lo que ocurre a lo largo de miles de filas y muchas entradas, esta puede contarte lo que ocurrió una vez, y lo dice.
Dos hallazgos se cumplen busques lo que busques. El primero es que las filas no son ofertas: nuestras 100 filas contenían solo 53 URLs de oferta distintas, con veintisiete enlaces repetidos y uno apareciendo cuatro veces en posiciones diferentes, así que cualquier recuento de empleos debe deduplicar primero - y la facturación sigue las filas, no los puestos únicos. El segundo es que date_posted es una antigüedad y no una fecha. Los valores eran 24h, 3d, 13d y 30d+, medidos en el momento de la ejecución, lo que significa que no se pueden parsear como fechas, no se pueden comparar entre ejecuciones y, en el caso de 30d+, no tienen límite superior alguno. Si necesitas fechas reales, registra cuándo ejecutaste el trabajo y dedúcelas.
Otros dos hallazgos son genuinamente interesantes y genuinamente irresueltos. El salario estaba presente en todas las filas de nuestra búsqueda, siempre con su procedencia añadida - 96 de 100 marcadas como aportadas por el empleador y el resto como estimación de Glassdoor - una distinción que conviene extraer en vez de descartar, ya que una es lo que publicó una empresa y la otra la conjetura de un modelo. Pero company_rating estaba vacía en las 100 filas y easy_apply ponía Yes en las 100, y una sola consulta no puede decirte si eso son propiedades del servicio o artefactos de la búsqueda que nos tocó ejecutar. Una búsqueda filtrada a candidaturas de un clic produciría exactamente el patrón que vimos. No vamos a resolverlo adivinando, así que la recomendación es concreta: ejecuta una búsqueda tuya contra las 500 filas gratis y mira esas dos columnas antes de construir nada que dependa de ellas. Tus primeras 500 filas no cuestan nada y no necesitan tarjeta.