検索露出とAI学習、なぜ二者択一だったのか
サイト運営者が長年抱えてきたジレンマがあります。コンテンツをAI学習に提供するか、それとも検索露出を諦めるか。 このトレードオフが生まれる理由は、Applebot・Bingbot・Googlebotといった大手クローラーが混在使用(Mixed-use)クローラーだからです。単一のクローラーが検索インデックス構築とAI学習を同時に担っています。片方を拒否すれば、もう片方も拒否されてしまうわけです。
Cloudflareはこの問題に正面から取り組む新設定Disallow AI Trainingを発表しました。要点はシンプルです。検索用クロールは許可しつつ、同一クローラーによるAI学習利用は拒否できるようにしたのです。Apple、Google、Microsoftはこの設定を尊重する、あるいは期限付きで尊重することを表明しています。
本記事はCloudflare公式ブログのAccountable Mixed-use AI Crawlers発表を根拠資料として整理したものです。
なぜrobots.txtだけでは不十分なのか
「robots.txtにDisallowを書けばいいのでは?」と思われる方も多いでしょう。しかし問題は3つあります。
- 誰がクロールしているか識別できない。 User-Agentは偽装可能です。
- なぜクロールしているか分からない。 検索目的か学習目的かの区別がつきません。
- 無視するクローラーを止められない。 robots.txtに法的拘束力はありません。
Cloudflareはネットワークレイヤーでこの問題を解決します。選好を公開し、クローラーを識別し、目的を分類した上で、無視するものはブロックし、その結果をRadarにレポートします。日本のSI案件で外部委託運営されているサイトでは、この点が特に重要です。robots.txtは担当者が変わると放置されがちですが、ネットワークレベルの制御はインフラ担当者が一度設定すれば維持されます。

3つのクローラー行動分類と新しい設定値
Cloudflareはボットを**行動(behavior)**単位で分類します。1つのボットが複数の行動を持つ点がポイントです。
| 行動分類 | 説明 |
|---|---|
| Search | 検索インデックス構築目的のクロール |
| Training | モデル学習・ファインチューニング目的のクロール |
| Agent | ユーザーに代わってページを訪問するエージェント(チャットfetchボット、ブラウザ利用エージェント) |
新たに追加されたDisallow AI Trainingは、robots.txtにDisallow:ディレクティブを公開する形で動作します。Accountable混在クローラーは検索用として引き続き許可され、それ以外の学習専用クローラー(Amazon、Anthropic、Meta、OpenAIなど)はすべてブロックされます。
設定値の整理
Allow
→ すべてのクローラーを許可(他の設定やWAFルールでブロックされていない場合)
Disallow AI Training
→ robots.txtにno-training選好を公開
→ Accountable混在クローラーは検索用として許可を維持
→ それ以外の学習クローラーはすべてブロック
→ Training設定にのみ存在(Search、Agentには無し)
Block on pages with ads
→ 広告が検出されたページでのみクローラーをブロック(混在クローラー含む)
Block
→ すべてのクローラーをブロック(混在クローラー含む、検索もブロック)
注意点: 9月15日より、BlockおよびBlock on pages with adsが混在クローラーにも適用されます。つまり、検索露出を維持したい場合は必ずDisallow AI Trainingを選ぶ必要があります。Blockを選ぶとGooglebotまでブロックされ、検索から消えてしまいます。うっかりミスしやすいポイントです。
マイグレーション仕様(既存ドメイン)
これまで詳細コントロールを未設定だったドメインは、レガシーBlock AI Bots設定に応じて自動移行されます。
| (Legacy) Block AI | Search | Training | Agent |
|---|---|---|---|
| Disabled | Allow | Allow | Allow |
| Block | Allow | Disallow AI Training | Block on pages with ads |
| Block on pages with ads | Allow | Disallow AI Training | Block on pages with ads |
詳細コントロールを既に設定していたドメインは、実効的な効果が維持されるように移行されます。既存TrainingのBlock/Block on pages with adsは、いずれもDisallow AI Trainingに変わります。

Accountableボット、何を約束したのか
CloudflareはAccountableという指定を設けました。以下の要件を満たす、あるいは満たすことを約束したボット運営者に付与されます。
- robots.txt等の標準を通じたAI学習オプトアウト機構
- AI要約オプトアウト機構(来年にはCloudflare経由でも可能に)
- どのページが学習に提供されたかのURL単位の可視性+検索露出指標
- 学習オプトアウトが従来の検索結果に影響しないことの保証
主要ボット別の状況比較
| ボット | 学習オプトアウト手段 | 検索への影響 | 備考 |
|---|---|---|---|
| Applebot | robots.txt Applebot-Extended Disallow | 検索ランキングへの影響なし | URL単位の検査ツールは来年予定 |
| Googlebot | robots.txt Google-Extended Disallow + ウェブマスタートグル | 検索ランキングへの影響なし | URL単位の透明性ツールを近日公開予定 |
| Bingbot | NOARCHIVEメタタグ/Block URLsツール | 検索ランキングへの影響なし | robots.txtドメインレベル対応は2027年初頭目標 |
Bingbotは注意が必要です。robots.txt対応が2027年初頭予定のため、それまではDisallow AI Trainingを選んでもBingにno-training選好が自動伝達されません。Bingまで確実にブロックしたい場合はNOARCHIVEメタタグを別途追加する必要があります。
この技術の限界と注意事項
- robots.txtベースのため強制力がありません。 悪意あるクローラーは依然として無視できます。Cloudflareネットワークを利用していないサイトには効果がありません。
- Agent分類はまだ標準がありません。
ai-prefsなどの標準が成熟するまで、Agent向けDisallow設定は提供されません。 - AI要約(Summaries)は別問題です。 学習ブロックと要約ブロックは異なるイシューです。要約はサイト全体のon/offでは粗すぎるため、来年「どれだけ含めるか」を調整する機能が目標とされています。
- 国内の広告ベースメディアへの影響は大きいです。 AI要約消費者の40%以上が要約後に検索を終了するというデータがあります。逆にAI検索経由の訪問者は従来検索比で3〜5倍のコンバージョン率を示します。訪問者数を最適化するか、コンバージョン率を最適化するかで設定が変わります。
次のステップ学習方向
- Cloudflare RadarでAccountableボット運営者のコントロール/透明性/レポーティング状況を直接追跡しましょう。
- **IETF
ai-prefs**標準の議論をフォローアップすると、今後のrobots.txt拡張の方向性が見えます。 - フィードバックは
crawlercontrols@cloudflare.comへ直接送付可能です。

実務適用、こうすれば大丈夫です
まとめると以下の通りです。
- 検索は活かし、AI学習だけをブロックしたい →
Disallow AI Trainingを選択 - 混在クローラーまで完全に遮断したい →
Blockを選択(検索も諦める) - Bingまで確実にブロックしたい →
NOARCHIVEメタタグを併用 - 何もしなくていい → そのまま放置。既存設定は自動移行されます。
特に広告ベースで運営されている国内メディア/ブログでは、AI要約によるトラフィック減少とAI経由コンバージョン率上昇を天秤にかける必要があります。「とにかくブロック」ではなく、ビジネスモデルに合わせて選択することが重要です。
新規ドメインをオンボーディングする場合、広告収益の有無によってプリセットが異なって提案されます。広告で収益を得ているサイトは、TrainingがDisallow AI Training、AgentがBlock on pages with adsというより制限的な設定になります。オンボーディング中でも後からでも変更可能です。