Extrator de Vagas do Glassdoor - uma busca como linhas ordenadas e exportáveis
A busca de vagas do Glassdoor é feita para navegar: você rola, você clica, e a ordem que determinou o que você viu desaparece no instante em que sai da página. O Extrator de Vagas do Glassdoor, em vez disso, pega uma URL de busca e devolve os resultados como tabela - uma linha por resultado, carregando o cargo, a empresa, a localização, o salário anunciado com a fonte, o link da vaga, um trecho da descrição, o logotipo da empresa e a posição que o resultado ocupou no ranking. Monte a busca no Glassdoor com os filtros que quiser, envie a URL, e leve os resultados como CSV, JSON ou Excel.
Esta página é mais cautelosa que as outras deste site, e a razão merece vir na frente. Nossa evidência é uma única execução com dados de 100 linhas vinda de uma busca; outras cinco execuções não devolveram absolutamente nada. Os doze nomes de coluna são firmes - o cabeçalho da planilha coincide exatamente com as chaves do JSON e é idêntico nas seis execuções - mas cada número ao lado descreve aquela única busca, e não o serviço. Também não há referência publicada para este endpoint: o Glassdoor não aparece em lugar nenhum da documentação da API, então esta página não cita limite de lote, configuração de idioma ou região nem ordenação, porque não existe fonte para eles. Onde outras páginas daqui podem contar o que acontece ao longo de milhares de linhas e muitas entradas, esta pode contar o que aconteceu uma vez, e diz isso.
Dois achados valem para qualquer busca. O primeiro é que linhas não são vagas: nossas 100 linhas continham apenas 53 URLs de vaga distintas, com vinte e sete links repetidos e um aparecendo quatro vezes em posições diferentes, então qualquer contagem de vagas precisa deduplicar antes - e a cobrança segue linhas, não cargos únicos. O segundo é que date_posted é uma idade e não uma data. Os valores eram 24h, 3d, 13d e 30d+, medidos no momento da execução, o que significa que não dá para fazer parse como data, não dá para comparar entre execuções e, no caso de 30d+, não há limite superior nenhum. Se você precisa de datas reais, registre quando rodou o job e derive.
Outros dois achados são genuinamente interessantes e genuinamente não resolvidos. O salário estava presente em todas as linhas da nossa busca, sempre com a procedência acrescentada - 96 de 100 marcadas como informadas pelo empregador e o resto como estimativa do Glassdoor - uma distinção que vale extrair em vez de descartar, já que uma é o que a empresa publicou e a outra é o palpite de um modelo. Mas company_rating estava vazia nas 100 linhas e easy_apply dizia Yes nas 100, e uma única consulta não pode dizer se isso são propriedades do serviço ou artefatos da busca que por acaso rodamos. Uma busca filtrada para candidaturas em um clique produziria exatamente o padrão que vimos. Não vamos resolver isso chutando, então a recomendação é concreta: rode uma busca sua contra as 500 linhas grátis e olhe essas duas colunas antes de construir qualquer coisa que dependa delas. Suas primeiras 500 linhas não custam nada e não precisam de cartão.