Extracteur d'Offres Glassdoor - une recherche d'emploi en lignes classées et exportables
La recherche d'emploi de Glassdoor est faite pour être parcourue : vous faites défiler, vous cliquez, et l'ordre qui a déterminé ce que vous avez vu disparaît dès que vous quittez la page. L'Extracteur d'Offres Glassdoor prend au contraire une URL de recherche et renvoie ses résultats sous forme de tableau - une ligne par résultat, portant l'intitulé du poste, l'entreprise, le lieu, le salaire annoncé avec sa source, le lien vers l'annonce, un extrait de la description, le logo de l'entreprise et la position que le résultat occupait dans le classement. Construisez la recherche sur Glassdoor avec les filtres que vous voulez, soumettez l'URL, et repartez avec les résultats en CSV, JSON ou Excel.
Cette page est plus prudente que les autres de ce site, et la raison mérite d'être placée d'emblée. Notre preuve est une unique exécution renseignée de 100 lignes issue d'une recherche ; cinq autres exécutions n'ont rien renvoyé du tout. Les douze noms de colonnes sont fermes - l'en-tête du tableur correspond exactement aux clés du JSON et est identique sur les six exécutions - mais chaque chiffre à côté décrit cette seule recherche et non le service. Il n'existe pas non plus de référence publiée pour cet endpoint : Glassdoor n'apparaît nulle part dans la documentation de l'API, donc cette page ne cite aucune limite de lot, aucun réglage de langue ou de pays et aucun ordre de tri, faute de source. Là où d'autres pages ici peuvent vous dire ce qui se passe sur des milliers de lignes et de nombreuses entrées, celle-ci peut vous dire ce qui s'est passé une fois, et le dit.
Deux constats valent quoi que vous cherchiez. Le premier : les lignes ne sont pas des annonces. Nos 100 lignes ne contenaient que 53 URL d'annonces distinctes, avec vingt-sept liens répétés et un apparaissant quatre fois à des positions différentes ; tout comptage d'offres doit donc dédupliquer d'abord - et la facturation suit les lignes, pas les postes uniques. Le second : date_posted est un âge et non une date. Les valeurs étaient 24h, 3d, 13d et 30d+, mesurées au moment de l'exécution, ce qui signifie qu'elles ne se parsent pas comme des dates, ne se comparent pas d'une exécution à l'autre et, dans le cas de 30d+, n'ont aucune borne supérieure. S'il vous faut de vraies dates, notez quand vous avez lancé le job et déduisez-les.
Deux autres constats sont réellement intéressants et réellement non résolus. Le salaire était présent sur chaque ligne de notre recherche, toujours avec sa provenance ajoutée - 96 sur 100 marquées comme fournies par l'employeur et le reste comme estimation Glassdoor - une distinction à extraire plutôt qu'à jeter, puisque l'une est ce qu'une entreprise a publié et l'autre l'estimation d'un modèle. Mais company_rating était vide sur les 100 lignes et easy_apply indiquait Yes sur les 100, et une seule requête ne peut pas vous dire s'il s'agit de propriétés du service ou d'artefacts de la recherche que nous avons lancée. Une recherche filtrée sur les candidatures en un clic produirait exactement le motif que nous avons vu. Nous n'allons pas trancher en devinant, la recommandation est donc concrète : lancez une recherche à vous sur les 500 lignes gratuites et regardez ces deux colonnes avant de bâtir quoi que ce soit qui en dépende. Vos 500 premières lignes ne coûtent rien et ne nécessitent pas de carte bancaire.