検索露出とAI学習、なぜ二者択一だったのか

サイト運営者が長年抱えてきたジレンマがあります。コンテンツをAI学習に提供するか、それとも検索露出を諦めるか。 このトレードオフが生まれる理由は、Applebot・Bingbot・Googlebotといった大手クローラーが混在使用(Mixed-use)クローラーだからです。単一のクローラーが検索インデックス構築とAI学習を同時に担っています。片方を拒否すれば、もう片方も拒否されてしまうわけです。

Cloudflareはこの問題に正面から取り組む新設定Disallow AI Trainingを発表しました。要点はシンプルです。検索用クロールは許可しつつ、同一クローラーによるAI学習利用は拒否できるようにしたのです。Apple、Google、Microsoftはこの設定を尊重する、あるいは期限付きで尊重することを表明しています。

本記事はCloudflare公式ブログのAccountable Mixed-use AI Crawlers発表を根拠資料として整理したものです。

なぜrobots.txtだけでは不十分なのか

「robots.txtにDisallowを書けばいいのでは?」と思われる方も多いでしょう。しかし問題は3つあります。

  1. 誰がクロールしているか識別できない。 User-Agentは偽装可能です。
  2. なぜクロールしているか分からない。 検索目的か学習目的かの区別がつきません。
  3. 無視するクローラーを止められない。 robots.txtに法的拘束力はありません。

Cloudflareはネットワークレイヤーでこの問題を解決します。選好を公開し、クローラーを識別し、目的を分類した上で、無視するものはブロックし、その結果をRadarにレポートします。日本のSI案件で外部委託運営されているサイトでは、この点が特に重要です。robots.txtは担当者が変わると放置されがちですが、ネットワークレベルの制御はインフラ担当者が一度設定すれば維持されます。

Cloudflare dashboard showing Disallow AI Training toggle for mixed-use crawler controls Development Concept Image

3つのクローラー行動分類と新しい設定値

Cloudflareはボットを**行動(behavior)**単位で分類します。1つのボットが複数の行動を持つ点がポイントです。

行動分類説明
Search検索インデックス構築目的のクロール
Trainingモデル学習・ファインチューニング目的のクロール
Agentユーザーに代わってページを訪問するエージェント(チャットfetchボット、ブラウザ利用エージェント)

新たに追加されたDisallow AI Trainingは、robots.txtにDisallow:ディレクティブを公開する形で動作します。Accountable混在クローラーは検索用として引き続き許可され、それ以外の学習専用クローラー(Amazon、Anthropic、Meta、OpenAIなど)はすべてブロックされます。

設定値の整理

Allow
  → すべてのクローラーを許可(他の設定やWAFルールでブロックされていない場合)

Disallow AI Training
  → robots.txtにno-training選好を公開
  → Accountable混在クローラーは検索用として許可を維持
  → それ以外の学習クローラーはすべてブロック
  → Training設定にのみ存在(Search、Agentには無し)

Block on pages with ads
  → 広告が検出されたページでのみクローラーをブロック(混在クローラー含む)

Block
  → すべてのクローラーをブロック(混在クローラー含む、検索もブロック)

注意点: 9月15日より、BlockおよびBlock on pages with adsが混在クローラーにも適用されます。つまり、検索露出を維持したい場合は必ずDisallow AI Trainingを選ぶ必要があります。Blockを選ぶとGooglebotまでブロックされ、検索から消えてしまいます。うっかりミスしやすいポイントです。

マイグレーション仕様(既存ドメイン)

これまで詳細コントロールを未設定だったドメインは、レガシーBlock AI Bots設定に応じて自動移行されます。

(Legacy) Block AISearchTrainingAgent
DisabledAllowAllowAllow
BlockAllowDisallow AI TrainingBlock on pages with ads
Block on pages with adsAllowDisallow AI TrainingBlock on pages with ads

詳細コントロールを既に設定していたドメインは、実効的な効果が維持されるように移行されます。既存TrainingのBlock/Block on pages with adsは、いずれもDisallow AI Trainingに変わります。

Diagram comparing Search, Training, and Agent crawler behavior classifications on a network Software Concept Art

Accountableボット、何を約束したのか

CloudflareはAccountableという指定を設けました。以下の要件を満たす、あるいは満たすことを約束したボット運営者に付与されます。

  • robots.txt等の標準を通じたAI学習オプトアウト機構
  • AI要約オプトアウト機構(来年にはCloudflare経由でも可能に)
  • どのページが学習に提供されたかのURL単位の可視性+検索露出指標
  • 学習オプトアウトが従来の検索結果に影響しないことの保証

主要ボット別の状況比較

ボット学習オプトアウト手段検索への影響備考
Applebotrobots.txt Applebot-Extended Disallow検索ランキングへの影響なしURL単位の検査ツールは来年予定
Googlebotrobots.txt Google-Extended Disallow + ウェブマスタートグル検索ランキングへの影響なしURL単位の透明性ツールを近日公開予定
BingbotNOARCHIVEメタタグ/Block URLsツール検索ランキングへの影響なしrobots.txtドメインレベル対応は2027年初頭目標

Bingbotは注意が必要です。robots.txt対応が2027年初頭予定のため、それまではDisallow AI Trainingを選んでもBingにno-training選好が自動伝達されません。Bingまで確実にブロックしたい場合はNOARCHIVEメタタグを別途追加する必要があります。

この技術の限界と注意事項

  • robots.txtベースのため強制力がありません。 悪意あるクローラーは依然として無視できます。Cloudflareネットワークを利用していないサイトには効果がありません。
  • Agent分類はまだ標準がありません。 ai-prefsなどの標準が成熟するまで、Agent向けDisallow設定は提供されません。
  • AI要約(Summaries)は別問題です。 学習ブロックと要約ブロックは異なるイシューです。要約はサイト全体のon/offでは粗すぎるため、来年「どれだけ含めるか」を調整する機能が目標とされています。
  • 国内の広告ベースメディアへの影響は大きいです。 AI要約消費者の40%以上が要約後に検索を終了するというデータがあります。逆にAI検索経由の訪問者は従来検索比で3〜5倍のコンバージョン率を示します。訪問者数を最適化するか、コンバージョン率を最適化するかで設定が変わります。

次のステップ学習方向

  1. Cloudflare RadarでAccountableボット運営者のコントロール/透明性/レポーティング状況を直接追跡しましょう。
  2. **IETF ai-prefs**標準の議論をフォローアップすると、今後のrobots.txt拡張の方向性が見えます。
  3. フィードバックはcrawlercontrols@cloudflare.comへ直接送付可能です。

Developer configuring robots.txt Bot Preference Sync for Googlebot and Bingbot training opt-out Programming Illustration

実務適用、こうすれば大丈夫です

まとめると以下の通りです。

  • 検索は活かし、AI学習だけをブロックしたい → Disallow AI Trainingを選択
  • 混在クローラーまで完全に遮断したい → Blockを選択(検索も諦める)
  • Bingまで確実にブロックしたい → NOARCHIVEメタタグを併用
  • 何もしなくていい → そのまま放置。既存設定は自動移行されます。

特に広告ベースで運営されている国内メディア/ブログでは、AI要約によるトラフィック減少とAI経由コンバージョン率上昇を天秤にかける必要があります。「とにかくブロック」ではなく、ビジネスモデルに合わせて選択することが重要です。

新規ドメインをオンボーディングする場合、広告収益の有無によってプリセットが異なって提案されます。広告で収益を得ているサイトは、TrainingがDisallow AI Training、AgentがBlock on pages with adsというより制限的な設定になります。オンボーディング中でも後からでも変更可能です。

あわせて読みたい記事

本コンテンツは、信頼性の高い情報源をもとにAIツールを活用して作成され、編集者によるレビューを経て公開されています。専門家によるアドバイスの代替となるものではありません。