インポーターを書く前に知っておくべき点です。カラム数は実行をまたいで一定ではありません。
どの実行でも小文字の9カラムが返ります。domain、続いてcms、ecommerce、javascript、analytics、cdn、marketing、server、そして最後にtechnologies - 検出内容をカンマでつないだまとめです。この一式が信頼できる中核になります。
新しい実行では、この9つにさらに25が加わります。queryと、BuiltWith 独自のカテゴリ名を持つ先頭大文字の24カラム - Content Management System、Web Hosting Providers、SSL Certificates、Name Serverほかです。合計34カラム。下のデータ辞書は両方の一式を掲載し、どちらがどちらかを示しています。
インポーターは9カラムを前提に書き、25カラムは「あれば使う」扱いにしてください。カラムを位置で参照する読み取り処理や、ヘッダーが固定だと想定する処理は、もう一方の形に出会った時点で壊れます。
入力はドメインだけです。設定するフィルタはありません。
どちらの形式でも動作します - stripe.comのようなドメイン単体でも、https://shopify.comのような完全なURLでも。
12行・9つの異なるドメインを含む9件の実際のエクスポートから実測しました。最初の9つはどの実行にも現れ、残りは直近2件にのみ現れました。
Shopify。Shopify。Next.jsやjQueryがあります。Google AnalyticsやGoogle Tag Managerがあります。CloudflareやCloudFrontがあります。Intercom。nginx、cloudflare、Vercelがあります。analyticsと併存します。cdnと併存します。cmsと併存します。Google Workspaceでした。Next.js。en-USとenです。Viewport Metaでした。Klarna。Robots.txtとして返ります。カラム名のアンダースコアにご注意ください。HTTPSとして返ります。nginxとCloudflareです。Google Search Console, Facebook。nginxとcloudflareです。Intercom。ecommerceと併存します。カラム名の先頭が小文字である点にご注意ください。HTML5 Video。カラム名のスラッシュ前後にスペースがある点にご注意ください。割合ではなく実数です。34カラムの新しい形は、手元にある12行のうち4行にしか現れません。充足率として表すにはあまりに小さな標本なので、この表では実測どおり「4行すべてで空」と記し、それらのカラムが大規模にどう振る舞うかについては何も主張しません。小文字の9カラムはより確かな根拠があります。12行全体でdomainは毎回、technologiesは10行、serverは9行、cms、ecommerce、marketingはそれぞれ3行で届きました。単一のカラムを前提に構築する前に、ご自身のドメインをいくつか無料枠で実行してください。
いずれもドキュメントではなくエクスポートを読んで分かったことで、だからこそ紙幅を割く価値があります。
手元にある12行のうち2行は、domain以外のすべてのフィールドが空で返りました。technologiesも空です。これはエラーではなく実際の結果で、そのサイトが単に何にも一致しなかっただけです。空の行を失敗した照会ではなく通常の結果として扱えば、行数は入力と一致し続けます。
同じドメインを2回実行したところ、Name Serverの中で同じ4つのネームサーバーが2通りの順序で返りました。カンマで分割して集合として比較してください。この項目を文字列として差分比較すると、起きていない変更が報告されます。
あるエクスポートではCopyrightがhds-text--md">©として返りました。これは著作権表記ではなく、たまたま記号の隣にあったHTMLのclass属性の断片です。確認せずにこの項目を表示したり、ここから企業名を取り出したりしないでください。
cmsとContent Management Systemは同じ検出を表し、cdnとContent Delivery Networkも同様です。値の綴りが常に同じとは限りません。ある行ではserverがcloudflare、Web Hosting ProvidersがCloudflareでした。結合やグループ化の前に大文字小文字を正規化してください。
サイトが何の上で動いているかを知ることで、次の行動が変わる場面です。
自社製品が特定のプラットフォームに接続するなら、そのプラットフォーム自体が選別条件になります。ドメインのリストを実行しcms、ecommerce、analyticsで絞り込めば、連携が今日そのまま動くアカウントと、移行が必要なアカウントを分けられます。まったく別の商談であり、最初のメールの前に知っておく価値があります。
ある業界のすべてのドメインを実行し、cms、cdn、serverの値を数えてください。ベンダーの事例集ではなくサイト自体から引き出した、その市場が何に標準化したかの姿が得られます。そして外れ値がたいてい面白い部分です。
パートナー連携に開発工数を投じる前に、相手側に何があるかを知っておくと役立ちます。1行でサイトのホスティング、CDN、サーバー、アナリティクスが分かり、多くの場合それだけで不整合を早期に見つけられます。あるいは不整合がないことを確認できます。
サブスクリプションも最低額もシート課金もありません。最初の500行は当社負担で、その後は従量課金です。
新規アカウントごとに一度きり。クレジットカードは不要です。すでにスタックを知っているドメインに何行か使ってみる価値があります。関心のある種類のサイトでどのカラムが埋まるかが分かります。
1,000ドメインあたり約2ドル、1ドメインにつき1行です。何も検出されないドメインでもちょうど1行が返るため、予算を正確に組めます。
ボリューム料金、SLA、専用ワーカー、そして大規模なドメインセットを定期的に再確認するチーム向けの個別オンボーディング。件数をお知らせいただければお見積もりします。
LIVESCRAPER10をご利用ください。本サービスはサイトが何の上で動いているかを教えます。この2つは、それが誰のもので、どう機能しているかを教えます。
カタログの中でも軽い部類の問いですが、ただ主張するのではなく理由を述べる価値があります。
サイトが何で作られているかは、そのサイト自身が公開しています。サーバーヘッダー、スクリプトタグ、ビューポートのメタタグ、DNSレコードは、いずれもブラウザが訪問のたびに読み取るものです。ここでの検出は同じ観察を意図的に行い、書き留めたにすぎません。これらのカラムに個人データはありません。記述しているのはソフトウェアとインフラであって、人ではありません。
率直な留意点が2つあります。Copyrightカラムはページから1行を取得するため、個人運営のサイトではその行が個人名を含みうります。そうした行は連絡先データと同じ慎重さで扱ってください。またName ServerとEmail Hosting Providersはドメインのインフラを示します。公開情報ではありますが、分析ではなく公表しようとするなら配慮が必要な種類の情報でもあります。
当社側では、公開されている情報源のみを扱い、ログインの背後にあるものには触れず、データ層でサードパーティのトラッカーを動かさず、エクスポートは30日後に自動削除されます。
最もよくいただく質問です。他にもあればご連絡ください - 回答を書いているのはボットではなく人間です。
domain、cms、ecommerce、javascript、analytics、cdn、marketing、server、technologies。新しい実行ではさらにqueryと先頭大文字のカテゴリカラム24個が加わり、合計34になります。このページのデータ辞書はそのすべてを掲載し、どちらの一式に属するかを示しています。technologiesを含む他のすべてのカラムは空です。手元にある12行のうち2行がそうでした。エラーではなく実際の結果であり、出力の行数が入力と一致し続けることを意味します。technologiesは検出内容をカンマでつないだまとめです。プログラムで処理する場合は個別のカラムを解析してください。まとめの内容は実行がどちらの形を返したかに依存するため、サイトに何の変更がなくても、後の実行で同じドメインが別の文字列を返すことがあります。ウェブサイトが何で作られているかを知ると、その相手への接し方が変わります。自社製品が連携するEC プラットフォームをすでに使っている見込み客は、まず移行が必要な相手とはまったく別の商談です。特定のCDNとアナリティクス構成に標準化している競合は、その企業が身を置く市場の動き方について何かを物語ります。BuiltWithスクレイパーはそれを大規模に収集します。ドメインのリストを送信すると - stripe.com のようなドメイン単体でも、https://shopify.com のような完全なURLでも動作します - 各ドメインが、そのサイトで検出された技術を示す1行として返ります。
どの実行でも9カラムが返ります。ドメイン自体、続いてCMS、EC プラットフォーム、JavaScript のフレームワークまたはライブラリ、アナリティクスとタグ管理、CDN、マーケティング用ウィジェット、ウェブサーバー、そして最後に見つかったすべてをカンマでつないだまとめです。新しい実行ではこの9つにさらに25が加わります。送信したクエリが返され、BuiltWith 独自のカテゴリ名を持つ24カラム - Content Management System、Email Hosting Providers、Frameworks、Language、Mobile、Name Server、Payment、SSL Certificates、Web Hosting Providers、Web Master Registration、Widgets、Audio / Video Media などです。この2つの形という挙動が、インポーターを書く前に理解すべき最も重要な点です。常に存在する9カラムを前提に実装し、残りは任意として扱ってください。ヘッダーが固定だと想定する読み取り処理は、もう一方の形に出会った時点で壊れます。
あらかじめ知っておく価値のある点が4つあります。いずれもドキュメントからではなく、実際のエクスポートで観察されたものです。何も検出されないドメインでも1行は生成され、ドメインのカラムだけが埋まります。これは失敗ではなく通常の結果であり、出力と入力の行数を一致させ続けます。単一の項目に入るネームサーバーは、同じドメインの実行間で順序が変わるため、このカラムは文字列として差分比較するのではなくカンマで分割して集合として比較すべきです。Copyright カラムは当てにできません。あるエクスポートでは、たまたま著作権記号の隣にあったHTMLのclass属性の断片が返りました。確認せずに表示したり、企業名を取り出そうとしたりすべきではありません。そして小文字と先頭大文字のカラム群は重複しており、同じ検出を、値の大文字小文字が時に異なる形で示します。グループ化や結合を行うなら、この点が効いてきます。
法的な面では、これはカタログの中でも軽い部類のサービスです。理由は単純で、サイトが何で作られているかは、そのサイトがすべての訪問者に公開している情報だからです。サーバーヘッダー、スクリプトタグ、DNSレコードは、どのブラウザでもどの訪問でも読み取られます。それを意図的に記録することは、同じ観察を書き留めることにすぎません。どのカラムも人を記述しません。述べておくべき留意点は2つです。Copyright カラムはページから1行を取得するため、個人運営のサイトでは個人名を含みうること。そしてネームサーバーやメールホスティングといったインフラの詳細は、公開情報ではあっても、分析ではなく公表するつもりなら一考に値することです。ログインの背後にあるものには触れず、データ層でサードパーティのトラッカーは動かず、エクスポートは30日後に自動削除されます。無料で始めましょう。最初の500行は無料で、クレジットカードも不要です。