入力は求人ではなく雇用主です - 企業を挙げれば、その企業がいま掲載しているすべての職種を収集します。
1職種につき1行、それぞれ元のクエリのタグ付き - だから30社をまたぐ実行でも、入力リストに突き合わせられます。
キーワード検索はそのキーワードで上位に来た企業を返します。これは企業を起点に、その企業が出しているすべてを返します。ある雇用主の採用活動について、標本ではなく全数を得られるという違いです。
Glassdoor は Cloudflare で保護されており、だからこそオフィス IP から自作スクリプトを走らせると求人ではなく中間ページが返ってきます。レジデンシャル経路、レート制限、IP ローテーションはこちら側で処理します。そちら側はフォームか API 呼び出しだけです。
Most relevant か Newest First を選び、クエリごとの行数を先に制限すれば、クレジットは本当に必要な範囲に使われます。Glassdoor が返した順位はすべてのエクスポートに残るので、並べ替えても失われません。
各行は Glassdoor の企業求人ボードが表示するとおりの掲載内容を持ちます。職種名、雇用主、勤務地、掲載されている場合は給与レンジ、掲載からの経過、Easy Apply の表示、そして求人へのリンクです。
職種名は雇用主が書いたそのままの形で、大文字小文字も含めて返ります。以下の列一覧は仕様書ではなく実際の実行のヘッダー行です - 注目に値するのは、どの列がすべての行で空のまま届いたか、そして date_posted が日付ではなく経過時間だという点です。どちらも発見を待つのではなく明記しています。
実際の実行のヘッダー行から取得しました。当社のテストは単一の雇用主を対象としているため、各列の注記は雇用主全般で保証される挙動ではなく、その企業の求人の特徴として読んでください。
City, ST 形式ですが、United States という文字列だけの行もあります。全行で埋まっていますが、常に市区レベルとは限りません。(Employer provided)、(Glassdoor est.)、(Glassdoor Est.) — est. に2通りの表記がある点に注意し、大文字小文字を区別せずに照合してください。数値ではありません。24h、3d、9d などで、最大は 30d+。これは測定値ではなく上限です。全行で埋まっています。Yes、それ以外は空セル。No は一度も現れませんでした - 空欄が否定を表します。これに対してコードを書く前に、4点。第一に、date_posted が持つのは経過時間であり - 24h、9d、30d+ - 日付ではありません。日付として解析すれば全行で失敗し、30d+ は上限なので掲載が31日前なのか300日前なのか判別できません。第二に、company_rating、snippet、logo はすべての実行のすべての行で空でした。絞り込みに使えるデータではなく空のものとして設計してください。第三に、salary は数値ではなく整形された文字列で、括弧内の出所は (Glassdoor Est.) と (Glassdoor est.) で大文字小文字が揺れ、単位は照会したドメインに従います - glassdoor.com では K、glassdoor.co.in ではインドのラク L です。第四に、12列すべてが JSON と同様に CSV と XLSX にも存在します。ここでは列数の少ない形式はありません。
並び順とクエリごとの上限が、実行のコストとファイルに入る内容を決めます。企業リストをどう渡すかと合わせて、ジョブの開始前に選びます。
企業単位の採用データを使って、チームが実際に抱えている問いに答える例をいくつか。
企業が採用している対象は、その企業がこれから作ろうとしているものです。競合のボード全体を取得すれば、職種名が人員をどこに振り向けているかを教えてくれます。プラットフォームとデータ系の職種が並ぶのと、エンタープライズ営業が並ぶのとでは意味が違います。
人材を奪い合う相手すべてのボードをエクスポートし、掲載レンジを並べて比較します。給与列には各数値が雇用主提供か Glassdoor の推定かが示されるので、重み付けを変えられます。
ある機能の人員を増やしている企業は、そこに支出しようとしている企業です。ターゲットリストのボードを定期的に監視し、ある部門で新規掲載が急増したらアプローチのトリガーとして扱います。
サブスクリプションも、最低利用額も、継続請求もありません。最初の500行は当社負担 - その後は従量課金で、ここにある他のスクレイパーと同じ均一料金です。
すべての新規アカウントで初回のみ。クレジットカード不要。並び替え、クエリごとの上限、ファイルアップロード、すべてのエクスポート形式を含みます。
求人1,000件あたりおよそ $2。事前見積もりが実行開始前に行数とクレジット費用を表示します - 想定外の請求も、換算が必要な計算ユニットもありません。
継続的なモニタリングや非常に大規模な過去データ取得のための、ボリューム料金、専用ワーカー、SLA。数量をお知らせいただければお見積もりします。
LIVESCRAPER10 をご利用ください。短い答え: 公開されている求人情報についてはイエス - しかもこのエクスポートには特定の個人に関する情報が一切含まれません。
Glassdoor の求人情報は見つけられるために公開されています。職種名、勤務地、掲載給与レンジ、掲載からの経過、リンクは、ログインの有無にかかわらず、その企業の求人ページを開いた誰にでも表示されます。公開されている求人情報を労働市場の研究のために収集することは長く確立された慣行であり、ここではログインも応募もペイウォールも一切触れません。
この出力のどこにも人物は登場しません。採用担当者も、採用マネージャーも、応募者も、レビュー投稿者もいません - 列が説明するのは職種と、それを掲載している雇用主です。つまりこのデータの上に築く採用分析は、人ではなく企業の分析になります。レビューやプロフィールのエクスポートとは意味合いが大きく異なる立ち位置です。
Glassdoor 自身の利用規約は自動アクセスを制限しているため、これは法律の問題であると同時に規約の問題でもあります - サイトと契約関係がある場合は確認してください。当社はデータ層でサードパーティのトラッカーを一切使用せず、エクスポートは30日後に自動削除されます。
最も多くいただく質問です。他にもご質問があれば お問い合わせください - 回答を書くのはボットではなく人間です。
Livescraper の Glassdoor 企業求人スクレイパーは、雇用主のリストを採用データに変えます。Glassdoor の企業 URL を送信し - Jobs ページでも Overview ページでも、1行に1件ずつ入力するか、CSV、XLSX、TXT、Parquet ファイルとしてアップロード - 職種を関連度順で返すか新着順で返すかを選び、必要ならクエリごとの行数に上限を設け、ボードをきれいな CSV、Excel、JSON ファイルとしてダウンロードします。
各行は Glassdoor の企業求人ボードが表示するとおりの掲載内容を持ちます。雇用主が書いたそのままの職種名、勤務地、掲載されている場合の給与レンジ、掲載からの経過、Easy Apply の表示、求人へのパーマリンク、そして Glassdoor がクエリ内で与えた順位です。12列すべてがすべてのエクスポート形式に現れるため、スプレッドシートでも JSON と比べて失うものはありません。
戦略チームは競合のボード全体を読みます。企業が採用している対象は、その企業がこれから作ろうとしているものだからです。報酬チームは人材を奪い合う相手すべてのボードをエクスポートし、掲載レンジを比較しながら、雇用主提供の数値と Glassdoor の推定を別々に重み付けします。セールスチームはターゲットリストを定期的に監視し、ある部門での掲載の急増を購買シグナルとして扱います。
このデータセットについて、構築を始める前に効いてくる性質が2つあります。date_posted の列は日付ではなく経過時間 - 24h、9d、30d+ - を持ち、30d+ は1か月前の掲載と1年前の掲載を区別できない上限です。そして company_rating、snippet、logo は当社のテストでは値を持ちませんでした。フィルター条件ではなく、空のものとして設計してください。無料で始められます。最初の500行は費用もクレジットカードも不要で、その後は一律1行 $0.002 です。