Extracteur Google Careers - un site d'emploi, dans le détail
La plupart des données d'emploi sont minces par construction. Un agrégateur affiche un intitulé, une entreprise et un lieu, car c'est tout ce dont une ligne de résultats a besoin pour être cliquable. Les ennuis commencent quand vous voulez analyser plutôt que parcourir : savoir ce qu'un poste exige réellement, comment un employeur décrit la séniorité, ou lesquels de ses paris sont en train d'être dotés. L'Extracteur Google Careers lit le site carrières d'Alphabet lui-même et renvoie chaque poste ouvert comme une ligne portant l'annonce complète - la description, les qualifications minimales et souhaitées, les responsabilités telles qu'écrites, le lieu, la date et un lien de candidature direct. Soumettez jusqu'à 1 000 requêtes par exécution, réglez langue et pays, choisissez la profondeur par requête, et exportez en CSV, JSON ou Excel.
Les dix colonnes de cette page sont mesurées, pas supposées. Ce sont la ligne d'en-tête d'exports carrières Livescraper réels, identique sur 11 exécutions, et chaque taux de remplissage cité provient des 131 lignes que ces exécutions ont renvoyées - couvrant 68 intitulés de poste distincts et 52 lieux distincts. Cela compte, car la référence de cet endpoint documente entièrement le côté requête et n'énumère pas du tout les colonnes de réponse : une page qui se contenterait de répéter la documentation n'aurait pas pu vous dire ce qui arrive. Six colonnes étaient remplies sur chaque ligne : query, title, company, location, posted et description. Trois autres - apply_url, qualifications et responsibilities - apparaissaient sur 104 des 131. La dixième, job_id, est nommée dans l'en-tête mais était vide sur chaque ligne et n'apparaît pas du tout dans l'export JSON ; elle figure ici avec cette précision énoncée clairement plutôt qu'écartée en silence, car une colonne qui existe et ne se remplit jamais est exactement le genre de chose qui gâche un après-midi.
Quatre comportements mesurés méritent d'être connus avant d'écrire un importeur. Premièrement, ces trois colonnes partielles ne sont pas rares indépendamment - ce sont les mêmes 104 lignes à chaque fois, sans une seule ligne portant un ensemble partiel : elles se comportent donc comme un unique bloc facultatif et une vérification couvre les trois. Deuxièmement, posted est une véritable date ISO sur les 131 lignes, sans chaînes relatives mélangées : elle se parse et se trie sans normalisation ; notre échantillon va de juillet 2025 à juillet 2026, ce qui montre que les annonces persistent bien au-delà de quelques semaines. Troisièmement, location est une liste déguisée en chaîne : un poste ouvert dans plusieurs bureaux les met tous dans une cellule joints par une barre verticale, et une ligne de notre échantillon en portait dix-sept ainsi - découpez donc avant de regrouper par ville, sinon votre géographie sera absurde. Quatrièmement, company n'est pas une constante - le site carrières couvre le groupe Alphabet, et aux côtés de Google nous avons vu GFiber, Verily Life Sciences, Wing, Waymo et YouTube.
Les usages typiques découlent de la profondeur. Conseillers d'orientation et candidats lisent la colonne qualifications pour remplacer le folklore sur la barre d'embauche par le texte de la barre elle-même, minimum et souhaité séparés comme l'employeur les sépare. Les équipes RH et rémunération balaient tout le site et lisent comment les responsabilités progressent d'un niveau à l'autre au sein d'une famille de postes, ce qui constitue un intrant plus solide pour une grille de niveaux qu'une échelle d'intitulés empruntée ailleurs. Les équipes stratégie relancent à une cadence donnée et traitent le résultat comme une série temporelle, observant où des effectifs sont ajoutés dans le groupe - une grappe de nouveaux postes dans une filiale et une région est un signal qui précède généralement l'annonce. Une dernière note sur l'entrée : un simple terme de recherche fonctionne, et lors de nos exécutions une URL carrières filtrée collée directement a également fonctionné et renvoyé son ensemble de résultats sous forme de lignes. La référence publiée ne décrit que des requêtes textuelles : traitez donc la voie de l'URL comme observée et non promise, et confirmez-la sur l'offre gratuite. Vos 500 premières lignes ne coûtent rien et ne nécessitent pas de carte bancaire.