
AIクローラー リファレンスカード:すべてのボットを一目で
AIクローラーおよびボットの完全リファレンスガイド。GPTBot、ClaudeBot、Google-Extended、20種類以上のAIクローラーをユーザーエージェント・クロールレート・ブロック戦略とともに識別可能。...
AIクローラーとは、ウェブサイトを体系的に巡回しデータを収集する自動化されたボットですが、近年その目的は根本的に変化しています。従来の検索エンジンクローラー(Googlebotなど)が検索結果のためにコンテンツをインデックス化することに重点を置いていたのに対し、現代のAIクローラーは大規模言語モデルや生成AIシステムのトレーニングデータ収集を優先しています。Playwireの最近のデータによると、AIクローラーは現在、全AIボットトラフィックの約**80%**を占めており、ウェブサイトへの自動訪問者の量と多様性が劇的に増加しています。このガイドは参照リストです:現在アクティブなすべてのボット、運営企業、そして各ボットを識別、許可、またはブロックする方法を網羅しています。概念的な基礎—AIクローラーがGooglebotと機械的にどう異なるか、なぜJavaScriptをレンダリングできないか、クロールパターンの挙動—を先に理解したい場合は、以下のディレクトリに入る前にAIクローラーの解説 をお読みください。
AIクローラーは、その機能、動作、ウェブサイトへの影響に基づいて3つの明確なカテゴリーに分類できます。トレーニングクローラーは最大のセグメントを占め、AIボットトラフィックの約**80%**を占めており、機械学習モデルのトレーニングのためのコンテンツ収集を目的としています。これらのクローラーは通常、大量のトラフィックで動作し、参照トラフィックは最小限であるため、帯域幅を大量に消費しますが、訪問者をサイトに呼び戻す可能性は低いです。検索・引用クローラーは中程度のボリュームで動作し、AI搭載の検索結果やアプリケーションでコンテンツを検索・参照するために特化して設計されています。トレーニングクローラーとは異なり、これらのボットはAI生成の応答からユーザーがクリックしてサイトにトラフィックを送る可能性があります。ユーザートリガーフェッチャーは最も小さなカテゴリーを占め、ChatGPTのブラウジング機能などのAIアプリケーションを通じてユーザーが明示的にコンテンツ取得を要求したときにオンデマンドで動作します。これらのクローラーはボリュームは少ないですが、個々のユーザークエリとの関連性は高いです。
| カテゴリー | 目的 | 例 |
|---|---|---|
| トレーニングクローラー | AIモデルトレーニングのためのデータ収集 | GPTBot, ClaudeBot, Meta-ExternalAgent, Bytespider |
| 検索・引用クローラー | AI応答でのコンテンツ検索・参照 | OAI-SearchBot, Claude-SearchBot, PerplexityBot, You.com |
| ユーザートリガーフェッチャー | ユーザー向けにオンデマンドでコンテンツを取得 | ChatGPT-User, Claude-Web, Gemini-Deep-Research |

OpenAIは、AI業界で最も多様で積極的なクローラーエコシステムを運営しており、複数のボットが製品スイート全体で異なる目的を果たしています。GPTBotは主要なトレーニングクローラーであり、GPT-4および将来のモデルを改善するためのコンテンツ収集を担当しており、Cloudflareのデータによるとクローラートラフィックが驚異の305%増加しています。このボットは400:1のクロール対参照比率で動作し、サイトに送り返す訪問者1件に対して400回コンテンツをダウンロードします。OAI-SearchBotは全く異なる機能を果たし、コンテンツをモデルトレーニングに使用することなく、ChatGPTの検索機能のためのコンテンツの発見と引用に焦点を当てています。ChatGPT-Userは最も爆発的な成長カテゴリーを代表し、トラフィックが驚異の2,825%増加しており、ユーザーが「Browse with Bing」機能を有効にしてリアルタイムコンテンツをオンデマンドで取得するたびに動作します。これらのクローラーは、ユーザーエージェント文字列 GPTBot/1.0、OAI-SearchBot/1.0、ChatGPT-User/1.0 で識別でき、OpenAIは自社インフラからの正規のクローラートラフィックを確認するためのIP検証方法を提供しています。
Anthropic(Claudeの開発元)は、業界で最も選択的でありながら集中的なクローラー運用の1つを展開しています。ClaudeBotは主要なトレーニングクローラーであり、驚異の38,000:1のクロール対参照比率で動作し、送り返すトラフィックに対してOpenAIのボットよりもはるかに積極的にコンテンツをダウンロードします。この極端な比率は、モデルトレーニングのための包括的なデータ収集に対するAnthropicの注力を反映しています。Claude-WebとClaude-SearchBotは異なる目的を持ち、前者はユーザートリガーによるコンテンツ取得を処理し、後者は検索と引用の機能に特化しています。Googleは、AI時代に対応したクローラー戦略としてGoogle-Extendedを導入しました。これは、ウェブサイトが従来のGooglebotインデックスをブロックしながらAIトレーニングをオプトインできる特別なトークンであり、またGemini-Deep-ResearchはGoogleのAI製品ユーザー向けに詳細なリサーチクエリを実行します。多くのウェブサイト所有者は、Google-Extendedが検索トラフィックを統制する同じ企業からのものであるため、サードパーティのAIクローラーよりも判断が複雑になることから、ブロックすべきかどうか議論しています。
MetaはMeta-ExternalAgentによりAIクローラースペースで重要なプレーヤーとなっており、AIクローラートラフィックの約19%を占め、同社のAIモデルのトレーニングやFacebook、Instagram、WhatsApp全体の機能強化に使用されています。Meta-WebIndexerは補完的な機能を果たし、AI搭載機能やレコメンデーションのためのウェブインデックス化に重点を置いています。AppleはApplebot-Extendedを導入してApple Intelligence(オンデバイスAI機能)をサポートしており、同社がiPhone、iPad、Macデバイス全体でAI機能を拡大するにつれて、このクローラーは着実に成長しています。AmazonはAmazonbotを運用してAlexaやRufus(AIショッピングアシスタント)を強化しており、eコマースサイトや製品中心のコンテンツにとって重要です。PerplexityBotはクローラー業界で最も劇的な成長事例の1つであり、トラフィックが驚異の157,490%増加しており、検索代替としてのPerplexity AIの爆発的な成長を反映しています。この massive な成長にもかかわらず、Perplexityの絶対的なボリュームはOpenAIやGoogleに比べるとまだ小さいものの、その軌道は急速に重要性が高まっていることを示しています。
主要プレーヤー以外にも、インターネット上のウェブサイトから活発にデータを収集する多数の新興および専門AIクローラーが存在します。ByteDance(TikTokの親会社)が運営するBytespiderは、クローラートラフィックが劇的な85%減少を経験しており、戦略の転換またはトレーニングデータ収集ニーズの減少を示唆しています。Cohere、Diffbot、Common CrawlのCCBotは、言語モデルのトレーニングから構造化データ抽出まで、特定のユースケースに焦点を当てた専門クローラーを代表しています。You.com、Mistral、DuckDuckGoはそれぞれ独自のクローラーを運営してAI搭載の検索およびアシスタント機能をサポートしており、クローラー環境の複雑さが増しています。新しいクローラーの出現は定期的に発生しており、スタートアップや既存企業がウェブデータ収集を必要とするAI製品を継続的に立ち上げています。これらの新興クローラーについて情報を得ることは非常に重要です。なぜなら、それらをブロックまたは許可することが、新しいAI搭載ディスカバリープラットフォームやアプリケーションにおける可視性に大きな影響を与える可能性があるからです。
AIクローラーを識別するには、クローラーがどのように自己識別するかを理解し、サーバートラフィックパターンを分析する必要があります。ユーザーエージェント文字列は主要な識別方法であり、各クローラーはHTTPリクエスト内で特定の識別子を使用して自己を宣言します。例えば、GPTBotは GPTBot/1.0、ClaudeBotは Claude-Web/1.0、PerplexityBotは PerplexityBot/1.0 を使用します。サーバーログ(通常、Linuxサーバーでは /var/log/apache2/access.log、WindowsではIISログにあります)を分析することで、どのクローラーがサイトにアクセスし、どの程度の頻度かを確認できます。IP検証も重要なテクニックであり、OpenAIやAnthropicからのクローラーを名乗るものが実際にこれらの企業がセキュリティ目的で公開している正規のIP範囲から来ているかを確認できます。robots.txtファイルを調べると、明示的に許可またはブロックしたクローラーがわかり、実際のトラフィックと比較することでクローラーが指示を尊重しているかがわかります。Cloudflare Radarなどのツールは、クローラートラフィックパターンをリアルタイムで可視化し、サイトで最もアクティブなボットを特定するのに役立ちます。実践的な識別手順には以下が含まれます:分析プラットフォームでボットトラフィックを確認する、生のサーバーログでユーザーエージェントパターンを確認する、IPアドレスを公開クローラーIP範囲とクロスリファレンスする、オンラインのクローラー検証ツールを使用して不審なトラフィックソースを確認する。

AIクローラーを許可するかブロックするかの判断には、一律の答えがない複数の競合するビジネス上の考慮事項のバランスを取る必要があります。主なトレードオフは以下の通りです:
AIボットトラフィックの80%はトレーニングクローラーからのもので、参照の可能性は最小限であるため、多くのパブリッシャーは検索クローラーと引用クローラーを許可しながらトレーニングクローラーをブロックすることを選択しています。この判断は最終的に、ビジネスモデル、コンテンツタイプ、およびAIでの可視性とリソース消費に関する戦略的優先事項に依存します。
robots.txtファイルは、AIボットにクローラーポリシーを伝えるための主要なツールですが、準拠は任意であり技術的に強制力はないことを理解することが重要です。Robots.txtはユーザーエージェントマッチングを使用して特定のクローラーを対象とし、異なるボットに対して異なるルールを作成できます。例えば、GPTBotをブロックしながらOAI-SearchBotを許可したり、すべてのトレーニングクローラーをブロックしながら検索クローラーを許可することができます。最近の調査によると、上位10,000ドメインのうち**わずか14%**がAI固有のrobots.txtルールを実装しており、ほとんどのウェブサイトがまだAI時代に合わせたクローラーポリシーを最適化していないことを示しています。このファイルでは、ユーザーエージェント名を指定し、その後にDisallowまたはAllowディレクティブを記述するシンプルな構文を使用し、ワイルドカードを使用して類似の命名パターンを持つ複数のクローラーをマッチングできます。
以下に3つの実践的なrobots.txt設定シナリオを示します:
# シナリオ1:すべてのAIトレーニングクローラーをブロックし、検索クローラーを許可
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Meta-ExternalAgent
Disallow: /
User-agent: Amazonbot
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
# シナリオ2:すべてのAIクローラーを完全にブロック
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Meta-ExternalAgent
Disallow: /
User-agent: Amazonbot
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: OAI-SearchBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Applebot-Extended
Disallow: /
# シナリオ3:ディレクトリによる選択的ブロック
User-agent: GPTBot
Disallow: /private/
Disallow: /admin/
Allow: /public/
User-agent: ClaudeBot
Disallow: /
User-agent: OAI-SearchBot
Allow: /
robots.txtはあくまで推奨事項であり、悪意のあるクローラーや準拠しないクローラーは指示を完全に無視する可能性があることを覚えておいてください。ユーザーエージェントのマッチングは大文字小文字を区別しないため、gptbot、GPTBot、GPTBOTはすべて同じクローラーを指し、User-agent: *を使用してすべてのクローラーに適用されるルールを作成することもできます。
robots.txt以外にも、不要なAIクローラーに対するより強力な保護を提供するいくつかの高度な方法がありますが、それぞれ効果のレベルと実装の複雑さが異なります。IP検証とファイアウォールルールでは、AIクローラーに関連する特定のIP範囲からのトラフィックをブロックできます。これらの範囲はクローラー運営者のドキュメントから入手し、ファイアウォールまたはWeb Application Firewall(WAF)を設定してそれらのIPからのリクエストを拒否できますが、IP範囲が変更されるため継続的なメンテナンスが必要です。.htaccessによるサーバーレベルのブロックは、コンテンツを提供する前にユーザーエージェント文字列とIPアドレスをチェックすることでApacheサーバー保護を提供し、クローラーの準拠に依存するのではなくサーバーレベルで動作するため、robots.txtよりも信頼性の高い強制力を提供します。
高度なクローラーブロックのための実践的な**.htaccess**の例:
# サーバーレベルでAIトレーニングクローラーをブロック
<IfModule mod_rewrite.c>
RewriteEngine On
# ユーザーエージェント文字列でブロック
RewriteCond %{HTTP_USER_AGENT} (GPTBot|ClaudeBot|Meta-ExternalAgent|Amazonbot|Bytespider) [NC]
RewriteRule ^.*$ - [F,L]
# IPアドレスでブロック(例示IP - 実際のクローラーIPに置き換えてください)
RewriteCond %{REMOTE_ADDR} ^192\.0\.2\.0$ [OR]
RewriteCond %{REMOTE_ADDR} ^198\.51\.100\.0$
RewriteRule ^.*$ - [F,L]
# 特定のクローラーを許可しながら他をブロック
RewriteCond %{HTTP_USER_AGENT} !OAI-SearchBot [NC]
RewriteCond %{HTTP_USER_AGENT} (GPTBot|ClaudeBot) [NC]
RewriteRule ^.*$ - [F,L]
</IfModule>
# HTMLメタタグアプローチ(ページヘッダーに追加)
# <meta name="robots" content="noarchive, noimageindex">
# <meta name="googlebot" content="noindex, nofollow">
HTMLメタタグ(<meta name="robots" content="noarchive">や<meta name="googlebot" content="noindex">など)はページレベルの制御を提供しますが、クローラーがそれらを認識するにはHTMLを解析する必要があるため、サーバーレベルのブロックよりも信頼性が低くなります。IPスプーフィングは技術的に可能であり、高度な攻撃者が正規のクローラーIPを偽装する可能性があるため、複数の方法を組み合わせることで単一のアプローチに依存するよりも優れた保護が得られます。各方法には異なる利点があります:robots.txtは実装は簡単ですが強制力はなく、IPブロックは信頼性が高いですがメンテナンスが必要で、.htaccessはサーバーレベルの強制力を提供し、メタタグはページレベルの粒度を提供します。
クローラーポリシーの実装は戦いの半分に過ぎません。クローラーが指示を尊重しているかを積極的に監視し、実際のトラフィックパターンに基づいて戦略を調整する必要があります。サーバーログは主要なデータソースであり、通常Linuxサーバーでは /var/log/apache2/access.log、WindowsサーバーではIISログディレクトリにあり、特定のユーザーエージェント文字列を検索してどのクローラーがどの程度の頻度でサイトにアクセスしているかを確認できます。Google Analytics、Matomo、Plausibleなどの分析プラットフォームは、ボットトラフィックを人間の訪問者から分離して追跡するように設定でき、時間の経過に伴う異なるクローラーのボリュームと動作を確認できます。Cloudflare Radarは、インターネット全体のクローラートラフィックパターンをリアルタイムで可視化し、サイトのクローラートラフィックが業界平均と比較してどうかを示します。クローラーがブロックを尊重しているかを検証するには、オンラインツールを使用してrobots.txtファイルをチェックし、ブロックされたユーザーエージェントのサーバーログを確認し、IPアドレスを公開クローラーIP範囲とクロスリファレンスして、トラフィックが実際に正規のソースから来ていることを確認します。実践的な監視手順には以下が含まれます:週次のログ分析を設定してクローラーボリュームを追跡する、異常なクローラーアクティビティのアラートを設定する、月次の分析ダッシュボードでボットトラフィックの傾向を確認する、四半期ごとにクローラーポリシーを見直してビジネス目標に合致していることを確認する。定期的な監視は、新しいクローラーの特定、ポリシー違反の発見、どのクローラーを許可またはブロックするかについてのデータ駆動型の意思決定に役立ちます。
上記の確立された名称に加えて、新しいエントリーが定期的にこのディレクトリに加わっています。xAI(Grok)、Mistral、DeepSeekなどの企業からの新興クローラーが大規模なウェブデータ収集を開始しており、立ち上がる新しいAIスタートアップはそれぞれ、モデルトレーニングと製品機能をサポートするために独自のクローラーを導入するでしょう。エージェンティックブラウザは全く新しいカテゴリーを代表しており、ChatGPT OperatorやCometなどのシステムは人間のユーザーと同じようにウェブサイトと対話し、ボタンをクリックし、フォームに入力し、複雑なインターフェースをナビゲートできます。これらのブラウザベースのエージェントは、従来の方法では識別とブロックがより困難であるため、独自の課題を提起します。問題は、ブラウザベースのエージェントがユーザーエージェント文字列で明確に自己識別せず、レジデンシャルプロキシや分散インフラストラクチャを使用してIPベースのブロックを回避できる可能性があることです。新しいクローラーは時にはほとんど警告なしに定期的に出現するため、このリストを固定されたインベントリではなく生きたドキュメントとして扱い、定期的にサーバーログをクロスリファレンスしてまだ認識していないユーザーエージェント文字列を確認してください。
ウェブサイトへのクローラーアクセスを管理することは重要ですが、同様に重要なのは、あなたのコンテンツがAI生成応答内でどのように使用され、引用されているかを理解することです。AmICited.comは、この問題を解決するために設計された専門プラットフォームであり、AIクローラーがどのようにコンテンツを収集しているかを追跡し、AI搭載アプリケーションでブランドとコンテンツが適切に引用されているかを監視します。このプラットフォームは、どのAIシステムがコンテンツを使用しているか、情報がAI応答にどの程度の頻度で表示されるか、元のソースに適切な帰属表示が提供されているかを理解するのに役立ちます。パブリッシャーとコンテンツクリエイターにとって、AmICited.comはAIエコシステム内での可視性に関する貴重な洞察を提供し、クローラーを許可またはブロックする決定の影響を測定し、AI搭載ディスカバリーから得られる実際の価値を理解するのに役立ちます。複数のAIプラットフォームでの引用を監視することで、クローラーポリシーについてより情報に基づいた決定を下し、AI応答でのコンテンツの可視性を向上させる機会を特定し、知的財産が適切に帰属表示されていることを確認できます。AI駆動のウェブにおける自社ブランドの存在を真剣に理解したいのであれば、AmICited.comは、このAI駆動ディスカバリーの新しい時代において、情報を把握しコンテンツの価値を保護するために必要な透明性と監視機能を提供します。
Viktor Zemanは、QualityUnitの共同オーナーです。20年にわたり会社を率いてきた今もなお、本質的にはソフトウェアエンジニアであり、AI、プログラマティックSEO、バックエンド開発を専門としています。LiveAgent、PostAffiliatePro、FlowHunt、UrlsLabをはじめ、数多くのプロジェクトに貢献してきました。


AIクローラーおよびボットの完全リファレンスガイド。GPTBot、ClaudeBot、Google-Extended、20種類以上のAIクローラーをユーザーエージェント・クロールレート・ブロック戦略とともに識別可能。...

どのAIクローラーをrobots.txtで許可またはブロックすべきかを解説。GPTBot、ClaudeBot、PerplexityBotなど25種類以上のAIクローラーと設定例を網羅した総合ガイド。...

GPTBot、ClaudeBot、PerplexityBotなどのAIクローラー向けにrobots.txtを設定する方法を学びましょう。AIクローラーのカテゴリ、ブロック戦略、不正なAIトレーニングデータ収集からコンテンツを保護するためのベストプラクティスを理解してください。...