검색 노출과 AI 학습, 왜 양자택일이었나
사이트 운영자들이 오랫동안 겪어온 딜레마가 있습니다. 콘텐츠를 AI 학습에 넘겨주거나, 아니면 검색 노출을 포기하거나. 이 트레이드오프가 생긴 이유는 Applebot, Bingbot, Googlebot 같은 대형 크롤러들이 혼합 사용(Mixed-use) 크롤러이기 때문입니다. 하나의 크롤러가 검색 인덱싱과 AI 학습을 동시에 수행하죠. 하나를 거부하면 다른 하나도 같이 거부됩니다.
Cloudflare가 이 문제를 정면으로 다룬 새 설정 Disallow AI Training을 발표했습니다. 핵심은 단순합니다. 검색용 크롤링은 허용하되, 같은 크롤러의 AI 학습 사용은 거부할 수 있게 만든 겁니다. Apple, Google, Microsoft는 이 설정을 존중하거나 존중하겠다고 일정과 함께 약속했습니다.
참고로 이 내용은 Cloudflare 공식 블로그의 Accountable Mixed-use AI Crawlers 발표를 근거자료로 정리했습니다.
왜 robots.txt만으로는 부족한가
여기서 많은 분들이 "robots.txt에 Disallow 쓰면 되는 거 아닌가?"라고 생각하실 텐데요. 문제는 세 가지입니다.
- 누가 크롤링하는지 식별할 수 없습니다. User-Agent는 위조 가능합니다.
- 왜 크롤링하는지 알 수 없습니다. 검색인지 학습인지 구분이 안 됩니다.
- 무시하는 크롤러를 막을 수 없습니다. robots.txt는 법적 구속력이 없습니다.
Cloudflare는 네트워크 레벨에서 이 문제를 해결합니다. 선호도를 게시하고, 크롤러를 식별하고, 목적을 분류한 뒤, 무시하는 녀석은 차단하고, 그 결과를 Radar에 리포트합니다. 국내 SI 환경에서 외주로 운영되는 사이트라면 특히 이 지점이 중요합니다. robots.txt는 담당자가 바뀌면 방치되기 쉬운데, 네트워크 레벨 제어는 인프라 담당자가 한 번만 설정하면 유지됩니다.
![]()
3가지 크롤러 행동 분류와 새 설정값
Cloudflare는 봇을 행동(behavior) 기준으로 분류합니다. 하나의 봇이 여러 행동을 가질 수 있다는 게 포인트입니다.
| 행동 분류 | 설명 |
|---|---|
| Search | 검색 인덱스 구축 목적 크롤링 |
| Training | 모델 학습/파인튜닝 목적 크롤링 |
| Agent | 사용자를 대신해 페이지를 방문하는 에이전트 (챗 fetch 봇, 브라우저 유즈 에이전트) |
새로 추가된 Disallow AI Training은 robots.txt에 Disallow: 디렉티브를 게시하는 방식으로 동작합니다. Accountable 혼합 크롤러는 검색용으로 계속 허용되고, 그 외 학습 전용 크롤러(Amazon, Anthropic, Meta, OpenAI 등)는 전부 차단됩니다.
설정값 정리
Allow
→ 모든 크롤러 허용 (다른 설정이나 WAF 룰에 막히지 않은 경우)
Disallow AI Training
→ robots.txt에 no-training 선호도 게시
→ Accountable 혼합 크롤러는 검색용으로 허용 유지
→ 그 외 학습 크롤러는 전부 차단
→ Training 설정에만 존재 (Search, Agent에는 없음)
Block on pages with ads
→ 광고가 감지된 페이지에서만 크롤러 차단 (혼합 크롤러 포함)
Block
→ 모든 크롤러 차단 (혼합 크롤러 포함, 검색도 차단됨)
주의할 점: 9월 15일부터 Block과 Block on pages with ads가 혼합 크롤러에도 적용됩니다. 즉, 검색 노출을 유지하고 싶다면 반드시 Disallow AI Training을 써야 합니다. Block을 선택하면 Googlebot까지 차단되어 검색에서 사라집니다. 실수하기 딱 좋은 지점이에요 😅
마이그레이션 규칙 (기존 도메인)
기존에 세분화된 컨트롤을 안 쓰던 도메인은 레거시 Block AI Bots 설정에 따라 자동 이관됩니다.
| (Legacy) Block AI | Search | Training | Agent |
|---|---|---|---|
| Disabled | Allow | Allow | Allow |
| Block | Allow | Disallow AI Training | Block on pages with ads |
| Block on pages with ads | Allow | Disallow AI Training | Block on pages with ads |
세분화 컨트롤을 이미 쓰던 도메인은 실질 효과가 유지되도록 이관됩니다. 기존 Training의 Block / Block on pages with ads는 모두 Disallow AI Training으로 바뀝니다.
![]()
Accountable 봇, 무엇을 약속했나
Cloudflare는 Accountable이라는 지정을 만들었습니다. 다음 요건을 충족하거나 충족하겠다고 약속한 봇 운영자에게 부여됩니다.
- robots.txt 등 표준을 통한 AI 학습 옵트아웃 메커니즘
- AI 요약 옵트아웃 메커니즘 (내년에는 Cloudflare를 통해서도 가능)
- 어떤 페이지가 학습에 제공됐는지 URL 단위 가시성 + 검색 노출 지표
- 학습 옵트아웃이 전통적 검색 결과에 영향을 주지 않는다는 보장
주요 봇별 현황 비교
| 봇 | 학습 옵트아웃 수단 | 검색 영향 | 비고 |
|---|---|---|---|
| Applebot | robots.txt Applebot-Extended Disallow | 검색 랭킹 영향 없음 | URL 단위 검사 도구는 내년 예정 |
| Googlebot | robots.txt Google-Extended Disallow + 웹마스터 토글 | 검색 랭킹 영향 없음 | URL 단위 투명성 도구 곧 출시 예정 |
| Bingbot | NOARCHIVE 메타 태그 / Block URLs 도구 | 검색 랭킹 영향 없음 | robots.txt 도메인 레벨 지원은 2027년 초 목표 |
Bingbot은 주의가 필요합니다. robots.txt 지원이 2027년 초로 예정되어 있어서, 그 전까지는 Disallow AI Training을 선택해도 Bing에는 자동으로 no-training 선호도가 전달되지 않습니다. Bing까지 확실히 막으려면 NOARCHIVE 메타 태그를 별도로 넣어야 합니다.
이 기술의 한계와 주의사항
- robots.txt 기반이라 강제력이 없습니다. 악의적 크롤러는 여전히 무시할 수 있습니다. Cloudflare 네트워크를 쓰지 않는 사이트에는 아무 효과가 없습니다.
- Agent 분류는 아직 표준이 없습니다.
ai-prefs같은 표준이 성숙할 때까지 Agent용 Disallow 설정은 제공되지 않습니다. - AI 요약(Summaries)은 별개 문제입니다. 학습 차단과 요약 차단은 다른 이슈입니다. 요약은 사이트 전체 on/off가 너무 뭉툭해서, 내년에 "얼마나 포함할지" 조절하는 기능이 목표라고 합니다.
- 국내 광고 기반 미디어에는 영향이 큽니다. AI 요약 소비자의 40% 이상이 요약 후 검색을 종료한다는 데이터가 있습니다. 반대로 AI 검색 경유 방문자는 전통 검색 대비 3~5배 전환율을 보입니다. 방문자 수를 최적화할지, 전환율을 최적화할지에 따라 설정이 달라져야 합니다.
다음 단계 학습 방향
- Cloudflare Radar에서 Accountable 봇 운영자들의 컨트롤/투명성/리포팅 현황을 직접 추적해보세요.
- IETF
ai-prefs표준 논의를 팔로업하면, 향후 robots.txt 확장 방향이 보입니다. - 피드백은
crawlercontrols@cloudflare.com으로 직접 보낼 수 있습니다.

실무 적용, 이렇게 하시면 됩니다
정리하면 이렇습니다.
- 검색은 살리고 AI 학습만 막고 싶다 →
Disallow AI Training선택 - 혼합 크롤러까지 완전히 차단하고 싶다 →
Block선택 (검색도 포기) - Bing까지 확실히 막고 싶다 →
NOARCHIVE메타 태그 병행 - 아무것도 안 하고 싶다 → 그냥 두세요. 기존 설정이 자동 이관됩니다.
특히 광고 기반으로 운영되는 국내 미디어/블로그라면, AI 요약으로 인한 트래픽 감소와 AI 경유 전환율 상승을 함께 저울질해야 합니다. "무조건 막는다"보다는 비즈니스 모델에 맞춰 선택하는 게 중요해요.
새 도메인을 온보딩하는 경우, 광고 수익 여부에 따라 프리셋이 다르게 제안됩니다. 광고로 수익을 내는 사이트는 Training이 Disallow AI Training, Agent가 Block on pages with ads로 더 제한적으로 세팅됩니다. 온보딩 중이나 이후 언제든 바꿀 수 있습니다.