검색 노출과 AI 학습, 왜 양자택일이었나

사이트 운영자들이 오랫동안 겪어온 딜레마가 있습니다. 콘텐츠를 AI 학습에 넘겨주거나, 아니면 검색 노출을 포기하거나. 이 트레이드오프가 생긴 이유는 Applebot, Bingbot, Googlebot 같은 대형 크롤러들이 혼합 사용(Mixed-use) 크롤러이기 때문입니다. 하나의 크롤러가 검색 인덱싱과 AI 학습을 동시에 수행하죠. 하나를 거부하면 다른 하나도 같이 거부됩니다.

Cloudflare가 이 문제를 정면으로 다룬 새 설정 Disallow AI Training을 발표했습니다. 핵심은 단순합니다. 검색용 크롤링은 허용하되, 같은 크롤러의 AI 학습 사용은 거부할 수 있게 만든 겁니다. Apple, Google, Microsoft는 이 설정을 존중하거나 존중하겠다고 일정과 함께 약속했습니다.

참고로 이 내용은 Cloudflare 공식 블로그의 Accountable Mixed-use AI Crawlers 발표를 근거자료로 정리했습니다.

왜 robots.txt만으로는 부족한가

여기서 많은 분들이 "robots.txt에 Disallow 쓰면 되는 거 아닌가?"라고 생각하실 텐데요. 문제는 세 가지입니다.

  1. 누가 크롤링하는지 식별할 수 없습니다. User-Agent는 위조 가능합니다.
  2. 왜 크롤링하는지 알 수 없습니다. 검색인지 학습인지 구분이 안 됩니다.
  3. 무시하는 크롤러를 막을 수 없습니다. robots.txt는 법적 구속력이 없습니다.

Cloudflare는 네트워크 레벨에서 이 문제를 해결합니다. 선호도를 게시하고, 크롤러를 식별하고, 목적을 분류한 뒤, 무시하는 녀석은 차단하고, 그 결과를 Radar에 리포트합니다. 국내 SI 환경에서 외주로 운영되는 사이트라면 특히 이 지점이 중요합니다. robots.txt는 담당자가 바뀌면 방치되기 쉬운데, 네트워크 레벨 제어는 인프라 담당자가 한 번만 설정하면 유지됩니다.

Cloudflare dashboard showing Disallow AI Training toggle for mixed-use crawler controls IT Technology Image

3가지 크롤러 행동 분류와 새 설정값

Cloudflare는 봇을 행동(behavior) 기준으로 분류합니다. 하나의 봇이 여러 행동을 가질 수 있다는 게 포인트입니다.

행동 분류설명
Search검색 인덱스 구축 목적 크롤링
Training모델 학습/파인튜닝 목적 크롤링
Agent사용자를 대신해 페이지를 방문하는 에이전트 (챗 fetch 봇, 브라우저 유즈 에이전트)

새로 추가된 Disallow AI Training은 robots.txt에 Disallow: 디렉티브를 게시하는 방식으로 동작합니다. Accountable 혼합 크롤러는 검색용으로 계속 허용되고, 그 외 학습 전용 크롤러(Amazon, Anthropic, Meta, OpenAI 등)는 전부 차단됩니다.

설정값 정리

Allow
  → 모든 크롤러 허용 (다른 설정이나 WAF 룰에 막히지 않은 경우)

Disallow AI Training
  → robots.txt에 no-training 선호도 게시
  → Accountable 혼합 크롤러는 검색용으로 허용 유지
  → 그 외 학습 크롤러는 전부 차단
  → Training 설정에만 존재 (Search, Agent에는 없음)

Block on pages with ads
  → 광고가 감지된 페이지에서만 크롤러 차단 (혼합 크롤러 포함)

Block
  → 모든 크롤러 차단 (혼합 크롤러 포함, 검색도 차단됨)

주의할 점: 9월 15일부터 Block과 Block on pages with ads가 혼합 크롤러에도 적용됩니다. 즉, 검색 노출을 유지하고 싶다면 반드시 Disallow AI Training을 써야 합니다. Block을 선택하면 Googlebot까지 차단되어 검색에서 사라집니다. 실수하기 딱 좋은 지점이에요 😅

마이그레이션 규칙 (기존 도메인)

기존에 세분화된 컨트롤을 안 쓰던 도메인은 레거시 Block AI Bots 설정에 따라 자동 이관됩니다.

(Legacy) Block AISearchTrainingAgent
DisabledAllowAllowAllow
BlockAllowDisallow AI TrainingBlock on pages with ads
Block on pages with adsAllowDisallow AI TrainingBlock on pages with ads

세분화 컨트롤을 이미 쓰던 도메인은 실질 효과가 유지되도록 이관됩니다. 기존 Training의 Block / Block on pages with ads는 모두 Disallow AI Training으로 바뀝니다.

Diagram comparing Search, Training, and Agent crawler behavior classifications on a network Dev Environment Setup

Accountable 봇, 무엇을 약속했나

Cloudflare는 Accountable이라는 지정을 만들었습니다. 다음 요건을 충족하거나 충족하겠다고 약속한 봇 운영자에게 부여됩니다.

  • robots.txt 등 표준을 통한 AI 학습 옵트아웃 메커니즘
  • AI 요약 옵트아웃 메커니즘 (내년에는 Cloudflare를 통해서도 가능)
  • 어떤 페이지가 학습에 제공됐는지 URL 단위 가시성 + 검색 노출 지표
  • 학습 옵트아웃이 전통적 검색 결과에 영향을 주지 않는다는 보장

주요 봇별 현황 비교

봇학습 옵트아웃 수단검색 영향비고
Applebotrobots.txt Applebot-Extended Disallow검색 랭킹 영향 없음URL 단위 검사 도구는 내년 예정
Googlebotrobots.txt Google-Extended Disallow + 웹마스터 토글검색 랭킹 영향 없음URL 단위 투명성 도구 곧 출시 예정
BingbotNOARCHIVE 메타 태그 / Block URLs 도구검색 랭킹 영향 없음robots.txt 도메인 레벨 지원은 2027년 초 목표

Bingbot은 주의가 필요합니다. robots.txt 지원이 2027년 초로 예정되어 있어서, 그 전까지는 Disallow AI Training을 선택해도 Bing에는 자동으로 no-training 선호도가 전달되지 않습니다. Bing까지 확실히 막으려면 NOARCHIVE 메타 태그를 별도로 넣어야 합니다.

이 기술의 한계와 주의사항

  • robots.txt 기반이라 강제력이 없습니다. 악의적 크롤러는 여전히 무시할 수 있습니다. Cloudflare 네트워크를 쓰지 않는 사이트에는 아무 효과가 없습니다.
  • Agent 분류는 아직 표준이 없습니다. ai-prefs 같은 표준이 성숙할 때까지 Agent용 Disallow 설정은 제공되지 않습니다.
  • AI 요약(Summaries)은 별개 문제입니다. 학습 차단과 요약 차단은 다른 이슈입니다. 요약은 사이트 전체 on/off가 너무 뭉툭해서, 내년에 "얼마나 포함할지" 조절하는 기능이 목표라고 합니다.
  • 국내 광고 기반 미디어에는 영향이 큽니다. AI 요약 소비자의 40% 이상이 요약 후 검색을 종료한다는 데이터가 있습니다. 반대로 AI 검색 경유 방문자는 전통 검색 대비 3~5배 전환율을 보입니다. 방문자 수를 최적화할지, 전환율을 최적화할지에 따라 설정이 달라져야 합니다.

다음 단계 학습 방향

  1. Cloudflare Radar에서 Accountable 봇 운영자들의 컨트롤/투명성/리포팅 현황을 직접 추적해보세요.
  2. IETF ai-prefs 표준 논의를 팔로업하면, 향후 robots.txt 확장 방향이 보입니다.
  3. 피드백은 crawlercontrols@cloudflare.com으로 직접 보낼 수 있습니다.

Developer configuring robots.txt Bot Preference Sync for Googlebot and Bingbot training opt-out Programming Illustration

실무 적용, 이렇게 하시면 됩니다

정리하면 이렇습니다.

  • 검색은 살리고 AI 학습만 막고 싶다 → Disallow AI Training 선택
  • 혼합 크롤러까지 완전히 차단하고 싶다 → Block 선택 (검색도 포기)
  • Bing까지 확실히 막고 싶다 → NOARCHIVE 메타 태그 병행
  • 아무것도 안 하고 싶다 → 그냥 두세요. 기존 설정이 자동 이관됩니다.

특히 광고 기반으로 운영되는 국내 미디어/블로그라면, AI 요약으로 인한 트래픽 감소와 AI 경유 전환율 상승을 함께 저울질해야 합니다. "무조건 막는다"보다는 비즈니스 모델에 맞춰 선택하는 게 중요해요.

새 도메인을 온보딩하는 경우, 광고 수익 여부에 따라 프리셋이 다르게 제안됩니다. 광고로 수익을 내는 사이트는 Training이 Disallow AI Training, Agent가 Block on pages with ads로 더 제한적으로 세팅됩니다. 온보딩 중이나 이후 언제든 바꿀 수 있습니다.

함께 보면 좋은 글

본 콘텐츠는 신뢰할 수 있는 출처를 바탕으로 AI 도구를 활용하여 초안이 작성되었으며, 편집자의 검토를 거쳐 발행되었습니다. 전문가의 조언을 대체하지 않습니다.