Tenten AIGEO
ブログに戻る
テクニカルAEO導入・実行

CloudflareでAIクローラーを管理する方法:無断クロールを遮断し、引用につながるBotは許可する

CloudflareでAIクローラーを遮断したい一方、AIの回答に自社情報が表示されなくなるのは避けたい。本記事では、学習・リアルタイム取得・検索インデックスという3種類のクローラーの違いを整理し、AI Crawl ControlとWAFカスタムルールを使って、不要なBotだけを正確に遮断しながらChatGPTやPerplexityから引用される経路を確保する方法を解説します。

Tenten GEO 編集部公開日 2024-12-025 分で読めます
CloudflareのシールドがAIクローラーのトラフィックを選別し、一部のロボットを通過させるコンセプト画像

AIクローラーをワンクリックで一括遮断できるのは便利に見えます。しかし実際には、自社サイトをAIの回答から締め出すことになりかねません。ChatGPTやPerplexityが引用元を探すクローラーと、モデル学習のためにコンテンツを収集するクローラーは、多くの場合、別のロボットです。Cloudflareの「Block AI Bots」を有効にすると、その両方がまとめて遮断されます。

多くのチームがAIによる自社サイトのクロールに初めて気づくのは、サーバートラフィックが理由もなく急増したとき、あるいは法務担当者から「当社のコンテンツが学習に使われていないか」と確認を求められたときです。反射的にCloudflareを開き、すべてのAIクローラーを遮断する設定を探したくなるでしょう。実際、Cloudflareにはそのためのスイッチがあり、操作はわずか3秒で済みます。ただし、B2B SaaSを展開し、AIエンジン経由の推奨やリード獲得を狙う企業にとって、一括遮断は商談につながる流入経路を自ら閉ざす行為です。本記事では、不要なクローラーだけを遮断し、引用につながるクローラーは通す「選別」の方法を解説します。

まず押さえるべきなのは、AIクローラーには3つの種類があり、すべてを同じように扱ってはいけないという点です。

ひとまとめに「AIクローラー」と呼ばれていても、実際の役割は3つに分かれます。この違いを理解して初めて、どれを遮断し、どれを許可すべきか判断できます。

  • 学習クローラー:コンテンツを収集し、モデルの学習に利用します。代表例は、OpenAIのGPTBot、AnthropicのClaudeBot、ByteDanceのBytespider、Common CrawlのCCBotです。これらを遮断しても、AIの回答における引用には影響しません。
  • リアルタイム取得クローラー:ユーザーがChatGPTやPerplexityで質問した際にページへアクセスし、その内容を回答に反映して出典を付けます。代表例は、OAI-SearchBot、ChatGPT-User、PerplexityBot、Perplexity-User、Claude-Userです。AIの回答に自社情報を表示させるうえで重要なクローラーであり、遮断すれば引用候補から外れてしまいます。
  • 検索インデックスクローラー:GooglebotとBingbotが該当します。役割は従来の検索だけではありません。Google AI OverviewsはGooglebotに依存し、ChatGPTとCopilotも一部の結果でBingを利用します。誤って遮断すると、SEOの検索流入とAI上の可視性が同時に低下します。

直感に反するかもしれませんが、学習クローラーを遮断しても、AIの回答から直ちに消えるわけではありません。回答で引用されるかどうかは、リアルタイム取得クローラーや検索インデックスクローラーが現在取得できるコンテンツによって決まります。数か月前のモデル学習に自社コンテンツが使われたかどうかとは別の問題です。つまり、学習利用は拒否しながら、今この瞬間の引用を狙うことはできます。そのためには、クローラーの役割を正しく見分ける必要があります。

ステップ1:Cloudflareで、どのクローラーが来ているかを把握する

遮断設定を始める前に、まず実態を確認します。Cloudflareの管理画面にある「AI Crawl Control」(旧称AI Audit)では、AIクローラーごとの直近のクロール回数、アクセスされたパス、現在の許可・遮断状況を確認できます。初めて開くと、BytespiderやGPTBotのリクエスト量がGooglebotを上回っていることに驚くかもしれません。この一覧が、その後の判断の基礎になります。実際にサーバーリソースを消費しているロボットはどれか、逆に一度も来ていないリアルタイム取得クローラーはどれかを確認しましょう。後者は、そのAIエンジンから自社サイトがまだ認識されていない可能性を示します。

3種類のAIクローラーと、それぞれに適した許可・遮断方針の比較図
学習型は遮断可能、リアルタイム取得型と検索インデックス型は許可が必要です。分類の違いが、AIに引用されるかどうかを左右します。

ステップ2:一括スイッチに頼らず、種類ごとに許可・遮断する

Cloudflareには強度の異なる3つの手段があり、組み合わせて使うのが効果的です。最も大ざっぱなのは、セキュリティ設定にある「Block AI Bots」の一括スイッチです。手軽ですが、リアルタイム取得クローラーまで巻き込むため、いわば核兵器のような設定です。AI上の可視性を一切重視しない場合を除き、使用は避けるべきでしょう。中間に位置するのがマネージドrobots.txtで、ルールを守る学習クローラーへの対応に適しています。最も精度が高いのは、ロボット単位で許可・遮断できるWAFカスタムルールです。実運用では、これが中心になります。

  1. WAFカスタムルールで遮断ルールを作成し、Bytespider、CCBot、GPTBot、ClaudeBotなど、学習クローラーのユーザーエージェントを条件に指定します。アクションはblock、または403を返す設定にします。
  2. 別途Skipルールを作成し、OAI-SearchBot、PerplexityBot、Perplexity-User、ChatGPT-User、Googlebot、Bingbotを明示的に許可します。遮断ルールよりも上位に配置し、リアルタイム取得と検索インデックスへのアクセスを常に確保します。
  3. ユーザーエージェント文字列だけで判定せず、Cloudflareの「verified bot」フィールドを条件に使用します。ユーザーエージェントは偽装でき、第三者がGooglebotを装うこともあるためです。verified botでは、CloudflareがリバースDNSや署名を用いて検証し、なりすましを排除します。
  4. さらに踏み込むなら、CloudflareのPay Per Crawlによって学習クローラーへHTTP 402を返し、クロール前に支払いを求めるという考え方もあります。無償でのコンテンツ利用を、収益や交渉材料へ変える仕組みです。

許可すべきクローラーと、遮断すべきクローラー

AIエンジンからの推奨を目指すなら、多くのB2B SaaSにとって基本方針は明確です。リアルタイム取得クローラーと検索インデックスクローラーはすべて許可し、学習クローラーだけを選択的に遮断します。特に注意したい落とし穴が2つあります。1つ目は、Google-ExtendedとGooglebotを混同しないことです。Google-Extendedは、コンテンツをGeminiの学習やグラウンディングに使用できるかどうかを制御するもので、遮断してもAI Overviewsから消えるわけではありません。しかしGooglebotまで遮断すれば、Googleのエコシステム全体から自社サイトが見えなくなります。2つ目は、Bingを遮断しないことです。ChatGPTとCopilotの一部の結果はBingのインデックスを利用しているため、Bingbotの遮断はそれらにも影響します。

ステップ3:意図しない遮断がないか検証する

ルールを公開したら、想定どおりに動いていると決めつけてはいけません。AI Crawl ControlとWAFのイベントログに戻り、学習クローラーには403が返っているか、リアルタイム取得クローラーとGooglebotには安定して200が返っているかを1つずつ確認します。よくある事故は、条件が広すぎる遮断ルールにGooglebotまで巻き込まれることです。AIだけを遮断したつもりでも、2週間後には自然検索順位が崩れ始める可能性があります。Google Search ConsoleでURLを検査するか、サーバーのレスポンスコードを直接確認し、1週間比較してください。許可リストが確実に機能していることを確認して、初めて設定完了です。

AIクローラーを遮断するだけなら簡単です。難しいのは、遮断すべきものだけを止め、回答への掲載につながるクローラーには、滞りなくアクセスしてもらうことです。Tenten GEO

クローラーの遮断は守りにすぎません。目的は、AIに引用されることです。

クローラートラフィックを管理する目的は、サーバーリソースの無断消費や、過剰なアクセスによるサーバーダウンを防ぐことです。ただし、リアルタイム取得クローラーを許可しただけでAIに引用されるわけではありません。クローラーがページを取得でき、内容を理解でき、引用に値すると判断できる状態にする必要があります。ここからがGEOの本当の勝負です。問われるのは、コンテンツ構造、エンティティマークアップ、プラットフォームをまたいだブランド情報の一貫性です。Cloudflareの適切な管理は、入口を開く作業にすぎません。回答に採用されるかどうかは、その先の戦いです。主要6つのAIエンジンで引用されない原因や、許可したクローラーへの対応が無駄になっていないかを確認したい方は、30分間のGEO診断をご予約ください。実際の質問を使い、どこに課題があるのかを可視化します。

よくある質問

CloudflareでAIクローラーを遮断すると、ChatGPTやPerplexityに表示されなくなりますか?
どのクローラーを遮断するかによります。GPTBotやClaudeBotなどの学習クローラーを遮断しても引用には影響しません。一方、OAI-SearchBotやPerplexityBotなどのリアルタイム取得クローラーを遮断すると、AIの回答に表示されなくなります。重要なのは種類ごとに処理を分け、一括遮断を使わないことです。
AIクローラーの遮断において、robots.txtとCloudflare WAFは何が違いますか?
robots.txtはクローラー側の自主性に依存する要請です。ルールを守るクローラーは従いますが、悪質なクローラーは無視します。WAFは、相手がルールに従うかどうかに関係なく、Cloudflareのエッジでリクエストを直接遮断する強制的な仕組みです。指示に従わないクローラーを確実に止めるには、WAFが必要です。
AIから引用されるために、どのクローラーを許可すべきですか?
少なくともOAI-SearchBot、ChatGPT-User、PerplexityBot、Perplexity-User、Claude-Userに加え、GooglebotとBingbotを許可してください。前者はChatGPTやPerplexityの回答に表示されるかどうかを左右し、後者の2つはGoogle AI OverviewsやCopilotにも影響します。

次の一手へ

あなたのブランドはAIの回答にどれだけ登場していますか?

30分のGEO診断で、主要AIエンジンにおける可視性の課題と、優先して改善すべきポイントを確認します。

30分の診断を予約