Glassdoor 企業求人スクレイパー

ある雇用主が
採用しているすべて

企業の Glassdoor の Jobs ページまたは Overview ページを指定するだけで、その雇用主の公開求人ボード全体が行データで返ります。職種名、勤務地、掲載給与レンジ、掲載からどれだけ経ったか、Easy Apply に対応しているか、そして各求人へのリンク。関連度順か新着順か、並びはお好みで。

初回のみ500行無料以降は1行 $0.00212列CSV · XLSX · JSON
仕組み

企業 URL を入れると、
ボード全体が出てくる

入力は求人ではなく雇用主です - 企業を挙げれば、その企業がいま掲載しているすべての職種を収集します。

  1. ステップ 1プラットフォームにサインインします。
  2. ステップ 2Glassdoor 企業求人スクレイパーを開きます。
  3. ステップ 3Glassdoor の企業 URL を1行に1件ずつ貼り付けます - Jobs ページでも Overview ページでも構いません - または CSV、XLSX、TXT、Parquet ファイルをアップロードします。
  4. ステップ 4クエリごとの上限を設定するか、空欄のままにしてすべて取得します。
  5. ステップ 5並び順 - Most relevant または Newest First - と出力形式を選びます。
  6. ステップ 6Get Data をクリックします。

1職種につき1行、それぞれ元のクエリのタグ付き - だから30社をまたぐ実行でも、入力リストに突き合わせられます。

チームが使う理由

1ページの検索結果ではなく、
ボード全体

キーワード単位ではなく雇用主単位

キーワード検索はそのキーワードで上位に来た企業を返します。これは企業を起点に、その企業が出しているすべてを返します。ある雇用主の採用活動について、標本ではなく全数を得られるという違いです。

Cloudflare の壁はこちらの問題

Glassdoor は Cloudflare で保護されており、だからこそオフィス IP から自作スクリプトを走らせると求人ではなく中間ページが返ってきます。レジデンシャル経路、レート制限、IP ローテーションはこちら側で処理します。そちら側はフォームか API 呼び出しだけです。

取得前に並べ替える

Most relevant か Newest First を選び、クエリごとの行数を先に制限すれば、クレジットは本当に必要な範囲に使われます。Glassdoor が返した順位はすべてのエクスポートに残るので、並べ替えても失われません。

返ってくるもの

12列、
1職種につき1行

各行は Glassdoor の企業求人ボードが表示するとおりの掲載内容を持ちます。職種名、雇用主、勤務地、掲載されている場合は給与レンジ、掲載からの経過、Easy Apply の表示、そして求人へのリンクです。

職種名は雇用主が書いたそのままの形で、大文字小文字も含めて返ります。以下の列一覧は仕様書ではなく実際の実行のヘッダー行です - 注目に値するのは、どの列がすべての行で空のまま届いたか、そして date_posted が日付ではなく経過時間だという点です。どちらも発見を待つのではなく明記しています。

データ辞書

12列、
すべてのエクスポート形式で

実際の実行のヘッダー行から取得しました。当社のテストは単一の雇用主を対象としているため、各列の注記は雇用主全般で保証される挙動ではなく、その企業の求人の特徴として読んでください。

query
送信した Glassdoor の企業 URL。そこから得られた各行に繰り返し入ります。
job_title
雇用主が書いたそのままの職種名。大文字小文字も含みます。全行で埋まっています。
company
雇用主の名称。これで結合する前に一度確認する価値があります: 名称の末尾に「jobs」が付くことがあります。
company_rating
雇用主の Glassdoor 評価を想定した列。
location
職種の勤務地。多くは2文字の米国州コードを使った City, ST 形式ですが、United States という文字列だけの行もあります。全行で埋まっていますが、常に市区レベルとは限りません。
salary
掲載レンジを整形した文字列。出所が括弧内に付きます。現れる接尾辞はちょうど3種類で、大文字小文字は当社ではなく Glassdoor 側の表記です: (Employer provided)(Glassdoor est.)(Glassdoor Est.)est. に2通りの表記がある点に注意し、大文字小文字を区別せずに照合してください。数値ではありません。
date_posted
日付ではなく経過時間です。値は 24h3d9d などで、最大は 30d+。これは測定値ではなく上限です。全行で埋まっています。
easy_apply
Easy Apply に対応する求人では文字列 Yes、それ以外は空セル。No は一度も現れませんでした - 空欄が否定を表します。
job_url
glassdoor.com 上の個別求人へのパーマリンク。全行で埋まっています。
snippet
説明文の抜粋を想定した列。
logo
雇用主のロゴ画像を想定した列。
position
クエリ内での1始まりの順位。選んだ並び順で Glassdoor が求人を返した順序に従い、どの実行でも1から n まで連続します。当社の他のスクレイパーと違い、これは JSON だけでなく CSV と XLSX にも入っています。

これに対してコードを書く前に、4点。第一に、date_posted が持つのは経過時間であり - 24h9d30d+ - 日付ではありません。日付として解析すれば全行で失敗し、30d+ は上限なので掲載が31日前なのか300日前なのか判別できません。第二に、company_ratingsnippetlogo はすべての実行のすべての行で空でした。絞り込みに使えるデータではなく空のものとして設計してください。第三に、salary は数値ではなく整形された文字列で、括弧内の出所は (Glassdoor Est.)(Glassdoor est.) で大文字小文字が揺れ、単位は照会したドメインに従います - glassdoor.com では K、glassdoor.co.in ではインドのラク L です。第四に、12列すべてが JSON と同様に CSV と XLSX にも存在します。ここでは列数の少ない形式はありません。

実行コントロール

スプレッドシートではなく、
ジョブ側で設定する

並び順とクエリごとの上限が、実行のコストとファイルに入る内容を決めます。企業リストをどう渡すかと合わせて、ジョブの開始前に選びます。

企業の Jobs URL 企業の Overview URL 並び順: Most relevant 並び順: Newest First クエリごとの上限 空欄ですべて取得 1行に1件貼り付け CSV アップロード XLSX アップロード TXT アップロード Parquet アップロード
よくあるワークフロー

ここで最もよく実行される
3つの仕事

企業単位の採用データを使って、チームが実際に抱えている問いに答える例をいくつか。

競合

競合のロードマップを求人ボードから読む

企業が採用している対象は、その企業がこれから作ろうとしているものです。競合のボード全体を取得すれば、職種名が人員をどこに振り向けているかを教えてくれます。プラットフォームとデータ系の職種が並ぶのと、エンタープライズ営業が並ぶのとでは意味が違います。

戦略 · プロダクト
報酬

掲載給与を企業間でベンチマークする

人材を奪い合う相手すべてのボードをエクスポートし、掲載レンジを並べて比較します。給与列には各数値が雇用主提供か Glassdoor の推定かが示されるので、重み付けを変えられます。

人事 · 報酬
セールス

採用を購買シグナルとして使う

ある機能の人員を増やしている企業は、そこに支出しようとしている企業です。ターゲットリストのボードを定期的に監視し、ある部門で新規掲載が急増したらアプローチのトリガーとして扱います。

セールス · RevOps
料金

実際に取得した
求人分だけのお支払い。

サブスクリプションも、最低利用額も、継続請求もありません。最初の500行は当社負担 - その後は従量課金で、ここにある他のスクレイパーと同じ均一料金です。

無料枠

500行無料 - $0

すべての新規アカウントで初回のみ。クレジットカード不要。並び替え、クエリごとの上限、ファイルアップロード、すべてのエクスポート形式を含みます。

ずっと $0
従量課金

無料枠の後は1行 $0.002

求人1,000件あたりおよそ $2。事前見積もりが実行開始前に行数とクレジット費用を表示します - 想定外の請求も、換算が必要な計算ユニットもありません。

一番人気
大量利用

カスタム · 大量利用

継続的なモニタリングや非常に大規模な過去データ取得のための、ボリューム料金、専用ワーカー、SLA。数量をお知らせいただければお見積もりします。

ご相談ください
最初の有料実行が10%オフ。チェックアウト時にコード LIVESCRAPER10 をご利用ください。
登録する
相性のよいツール

何を採用しているかと、
中はどうなのか

法的な話

Glassdoor の求人情報
スクレイピングするのは合法か?

短い答え: 公開されている求人情報についてはイエス - しかもこのエクスポートには特定の個人に関する情報が一切含まれません。

Glassdoor の求人情報は見つけられるために公開されています。職種名、勤務地、掲載給与レンジ、掲載からの経過、リンクは、ログインの有無にかかわらず、その企業の求人ページを開いた誰にでも表示されます。公開されている求人情報を労働市場の研究のために収集することは長く確立された慣行であり、ここではログインも応募もペイウォールも一切触れません。

この出力のどこにも人物は登場しません。採用担当者も、採用マネージャーも、応募者も、レビュー投稿者もいません - 列が説明するのは職種と、それを掲載している雇用主です。つまりこのデータの上に築く採用分析は、人ではなく企業の分析になります。レビューやプロフィールのエクスポートとは意味合いが大きく異なる立ち位置です。

Glassdoor 自身の利用規約は自動アクセスを制限しているため、これは法律の問題であると同時に規約の問題でもあります - サイトと契約関係がある場合は確認してください。当社はデータ層でサードパーティのトラッカーを一切使用せず、エクスポートは30日後に自動削除されます。

livescraper.app · 方針
公開されている求人情報のみ
ログインなし、アカウントに触れない
エクスポートに個人は含まれない
標準で GDPR に準拠
エクスポートは自動削除(30日)
規模を広げる前に Glassdoor 自身の規約をご確認ください。
よくある質問

登録前によく
聞かれること。

最も多くいただく質問です。他にもご質問があれば お問い合わせください - 回答を書くのはボットではなく人間です。

企業の Glassdoor 求人はどうやってスクレイピングしますか?+
Glassdoor 企業求人スクレイパーを使います:
  1. プラットフォームにサインインします。
  2. Glassdoor 企業求人スクレイパーを開きます。
  3. Glassdoor の企業 URL を1行に1件ずつ貼り付けます - Jobs ページでも Overview ページでも構いません - または CSV、XLSX、TXT、Parquet ファイルをアップロードします。
  4. クエリごとの上限を設定するか、空欄のままにしてすべて取得します。
  5. 並び順と出力形式を選びます。
  6. Get Data をクリックします。
どの Glassdoor URL を貼り付ければよいですか?+
企業の Jobs ページか Overview ページです - 形式は …-Jobs-E.htm と …-EI_IE… の2種類。どちらも同じ入力欄に1行1件で入ります。このスクレイパーは雇用主単位なので、キーワード検索の URL は想定された入力ではありません。
各求人で何が返ってきますか?+
12列です: 送信したクエリ、職種名、企業、企業評価、勤務地、給与、掲載からの経過、Easy Apply の表示、求人 URL、説明文の抜粋、ロゴ、クエリ内の順位。12列すべてが JSON と同様に CSV と XLSX にも存在します - 当社の他の一部のスクレイパーと違い、ここでは列数の少ない形式はありません。
date_posted は実際の日付ですか?+
いいえ。そしてこれがスクリプトを壊す可能性が最も高い点です。実行時点からの経過時間が入ります - 24h、3d、9d など、最大は 30d+。この最後の値は測定値ではなく上限です: 30d+ と表示された求人は31日前かもしれず1年前かもしれず、データ上は区別できません。実際の日付が必要な場合は、実行時のタイムスタンプから経過を引き、30d+ は上限なしとして扱ってください。
company_rating、snippet、logo がなぜ空なのですか?+
当社のテストでは値を持たなかったからです。分析の途中で気づくのではなく先にお伝えしています: この3つは絞り込みに使える項目ではなく、空のものとして設計してください。company_rating は二重に注意を促す価値があります。列名が、Glassdoor で最もよく知られた数値を約束しているからです。
給与はどんな形式ですか?+
出所を括弧内に添えた整形済みの文字列です。$90K - $116K (Employer provided) や $30K - $40K (Glassdoor Est.) のような形で、数値でも2つの数値でもありません。素朴なパーサーがつまずく点が2つあります: 括弧内の出所は Est. と est. で大文字小文字が揺れること、そして単位が照会したドメインに従い、glassdoor.com の行は K、glassdoor.co.in の行はインドのラク L を使うことです。
この列一覧はどのように検証されましたか?+
一致する2つの情報源に照らして検証しました: 実際の実行エクスポートのヘッダー行と、プラットフォーム自身が公開している列一覧です。列の注記が名前を超えて説明している内容は当社のテストに基づいており、そのテストは glassdoor.com と glassdoor.co.in を通じて照会した単一の雇用主を対象としています。したがって、それらの注記は雇用主全般で保証される挙動ではなく、ある企業の求人の特徴として読んでください。ご自身のリストで無料枠の実行をかけ、データの形をご確認ください。
ブロックされたり確認ページが出たりしますか?+
いいえ。Glassdoor は Cloudflare で保護されており、まさにそれが、オフィスやデータセンターの IP から自作スクリプトを走らせると求人ではなく中間ページが返ってくる理由です。レジデンシャル経路、レート制限、IP ローテーションはこちら側で処理します - そちら側はフォームか API 呼び出しだけで、プロキシプールを管理することは一切ありません。

最初の500件の求人は、
当店のおごり

すべての新規アカウントに初回のみ500行無料 - 有効期限なし。その後は従量課金で1行 $0.002 - お客様が言うまでカード登録は不要です。

即時有効 · カード不要

企業の Glassdoor 求人情報を大規模にスクレイピング

Livescraper の Glassdoor 企業求人スクレイパーは、雇用主のリストを採用データに変えます。Glassdoor の企業 URL を送信し - Jobs ページでも Overview ページでも、1行に1件ずつ入力するか、CSV、XLSX、TXT、Parquet ファイルとしてアップロード - 職種を関連度順で返すか新着順で返すかを選び、必要ならクエリごとの行数に上限を設け、ボードをきれいな CSV、Excel、JSON ファイルとしてダウンロードします。

各行は Glassdoor の企業求人ボードが表示するとおりの掲載内容を持ちます。雇用主が書いたそのままの職種名、勤務地、掲載されている場合の給与レンジ、掲載からの経過、Easy Apply の表示、求人へのパーマリンク、そして Glassdoor がクエリ内で与えた順位です。12列すべてがすべてのエクスポート形式に現れるため、スプレッドシートでも JSON と比べて失うものはありません。

戦略チームは競合のボード全体を読みます。企業が採用している対象は、その企業がこれから作ろうとしているものだからです。報酬チームは人材を奪い合う相手すべてのボードをエクスポートし、掲載レンジを比較しながら、雇用主提供の数値と Glassdoor の推定を別々に重み付けします。セールスチームはターゲットリストを定期的に監視し、ある部門での掲載の急増を購買シグナルとして扱います。

このデータセットについて、構築を始める前に効いてくる性質が2つあります。date_posted の列は日付ではなく経過時間 - 24h、9d、30d+ - を持ち、30d+ は1か月前の掲載と1年前の掲載を区別できない上限です。そして company_rating、snippet、logo は当社のテストでは値を持ちませんでした。フィルター条件ではなく、空のものとして設計してください。無料で始められます。最初の500行は費用もクレジットカードも不要で、その後は一律1行 $0.002 です。