O dilema que quebrou a web aberta

Por anos, donos de sites viveram um impasse cruel: deixar crawlers de uso misto (Applebot, Googlebot, Bingbot) indexarem seu conteúdo para busca — o que também significava permitir treinamento de modelos — ou bloquear tudo e perder visibilidade no Google.

É um péssimo acordo. Menos de 1% dos sites na Cloudflare bloqueiam bots de busca, mas 17% tentam ativamente bloquear treinamento. Essa diferença diz tudo: publishers querem ser encontrados, só não querem ser consumidos.

O problema é estrutural. Uma diretiva em robots.txt é só um pedido educado. Não identifica quem está rastreando, não classifica o motivo, e não para um crawler que simplesmente ignora. A resposta da Cloudflare é resolver isso na camada de rede — publicar a preferência, identificar o crawler, classificar a intenção, bloquear quem ignora, e reportar no Radar o que cada operador realmente faz.

근거자료: Cloudflare Blog — Accountable Mixed-Use AI Crawlers

O que mudou de verdade em 15 de setembro

A Cloudflare aposentou o antigo toggle "Block AI Bots" e colocou no lugar três controles granulares, aplicados no nível de domínio (zona):

  • Search — rastreamento para construir índice de busca
  • Training — rastreamento para treinar ou fazer fine-tune de modelo
  • Agent — agentes direcionados pelo usuário buscando páginas em nome de um humano

A configuração nova que importa é Disallow AI Training. Ela publica uma diretiva Disallow: via Bot Preference Sync no seu robots.txt, mantém crawlers de uso misto Accountable liberados para busca, e bloqueia todo crawler exclusivo de treinamento (Amazon, Anthropic, Meta, OpenAI).

Tabela de migração (legado → novo)

"Block AI" legadoSearchTrainingAgent
DesativadoAllowAllowAllow
BlockAllowDisallow AI TrainingBlock on pages with ads
Block on pages with adsAllowDisallow AI TrainingBlock on pages with ads

Se você já tinha configurado Training como Block ou Block on pages with ads, ambos migram para Disallow AI Training — preservando o efeito prático sem derrubar a busca.

Presets recomendados para domínios novos

ConfiguraçãoSem monetização por anúncioCom anúncios
Preference SyncAtivadoAtivado
SearchAllowAllow
TrainingAllowDisallow AI Training
AgentAllowBlock on pages with ads

Sites com anúncios recebem o preset mais restritivo porque receita de anúncio exige que um humano realmente chegue na página. Treinamento substitui essa visita por uma resposta sintetizada; agentes buscam a página sem ninguém ali para ver o anúncio.

Network diagram showing mixed-use AI crawlers split between search indexing and model training traffic

Operador por operador: o que funciona hoje de verdade

Nem todo crawler "Accountable" é igual. A designação reconhece tanto capacidades já entregues quanto compromissos com prazo — ou seja, parte disso é promessa até a data chegar.

Applebot

Opt-out de treinamento via regra Disallow para Applebot-Extended no robots.txt. Preferências de AI Summary podem ser expressas via diretiva nosnippet no HTML da página. Conteúdo paywall pode ser marcado para excluir do output generativo.

Gap: Ainda não tem ferramenta de inspeção em nível de URL. A Apple compartilhou detalhes de uma solução em andamento para o ano que vem. Afirmaram que desabilitar treinamento não impacta ranking de busca.

# robots.txt — opt-out de treinamento Applebot
User-agent: Applebot-Extended
Disallow: /

Googlebot

Opt-out via Disallow para Google-Extended no robots.txt, mais um toggle no Search Console para excluir conteúdo dos resultados generativos. O Google fornece métricas para busca e para resultados de AI summary.

Gap: Ferramentas de transparência em nível de URL para Google-Extended estão "previstas para as próximas semanas" — ainda não entregues.

# robots.txt — opt-out de treinamento Googlebot (busca intacta)
User-agent: Google-Extended
Disallow: /

Bingbot

Hoje só suporta opt-out de treinamento via meta tag NOARCHIVE ou pela ferramenta Block URLs / Content Removal da Microsoft. Preferência de no-training via robots.txt está prevista para o início de 2027.

Aviso crítico: Até isso sair, selecionar Disallow AI Training na Cloudflare não vai automaticamente comunicar uma preferência de no-training ao Bing via robots.txt. É o mesmo comportamento prático do antigo Training Block.

<!-- Opt-out de treinamento por página para Bingbot -->
<meta name="robots" content="NOARCHIVE">

Crawlers exclusivos de treinamento (Amazon, Anthropic, Meta, OpenAI)

Esses operadores separam seus crawlers de Search e Training, então a Cloudflare consegue bloquear o de treinamento sem tocar na busca. Sem dilema, sem negociação.

Cloudflare dashboard security settings panel displaying Disallow AI Training toggle for domain-level bot management Coding Session Visual

Limitações e o que ninguém está falando alto

1. "Accountable" é designação de marketing, não padrão

A Cloudflare inventou o termo. Não existe RFC do IETF para isso. Os requisitos são autodefinidos e a fiscalização é "vamos acompanhar no Radar". É melhor que nada, mas não é regime de compliance.

2. O compromisso do Bing para 2027 é longe demais

Se você é publisher e depende do Disallow AI Training hoje, o Bingbot ainda está treinando no seu conteúdo até a Microsoft entregar suporte a robots.txt. A meta tag NOARCHIVE é por página e fácil de esquecer.

3. AI Summaries é a metade não resolvida

Os controles atuais são binários: permite ou bloqueia summaries. A Cloudflare admite que é "instrumento bruto" e diz que o próximo foco é deixar você controlar quanto do seu conteúdo aparece num summary. Essa capacidade não existe ainda — é meta declarada para o início do ano que vem.

4. Os dados de conversão cortam para os dois lados

Números da própria Cloudflare: mais da metade dos consumidores leem summaries na Busca, e esses consumidores têm 40%+ mais chance de encerrar a busca depois de ler um. Mas tráfego referido por IA converte de 3× a 5× mais que tráfego de busca tradicional. Menos visitas, mais intenção. Se isso é bom ou ruim depende inteiramente do seu modelo de negócio — um publisher financiado por impressão de anúncio e um varejista DTC vão tirar conclusões opostas dos mesmos dados.

5. Agentes ainda não têm diretiva

Não existe padrão estabelecido para expressar preferências de Disallow a agentes. A Cloudflare está esperando ai-prefs e propostas similares amadurecerem. Até lá, controle de agente é limitado a "Block on pages with ads" ou nada.

Próximos passos

  • Audite suas configurações atuais no nível de domínio (zona) em Security Settings. Se você nunca mexeu nos controles granulares, foi migrado com base no seu estado legado de Block AI Bots — confirme se bate com sua intenção.
  • Se quer crawlers de uso misto fora completamente, agora você precisa selecionar Block explicitamente. Isso para Applebot, Bingbot e Googlebot — busca incluída.
  • Acompanhe a especificação ai-prefs no IETF. É lá que a batalha real de interoperabilidade está acontecendo.
  • Se você constrói infraestrutura adjacente a crawlers, leia o deep dive do AI SDK 7 para entender como frameworks de agentes estão evoluindo junto com esses controles.
  • Para pipelines de embedding multilíngue e RAG que ingerem conteúdo web, o breakdown do IBM Granite Embedding Multilingual R2 cobre as implicações do lado do modelo nas restrições de dados de treinamento.

Server infrastructure routing crawler requests through robots.txt preference sync for AI training opt-out Software Concept Art

Resumindo

O Disallow AI Training da Cloudflare é a primeira tentativa séria de quebrar o falso binário entre "indexado" e "treinado". O mecanismo técnico — classificação em nível de rede + sincronização de preferência no robots.txt — tem o formato certo. Os gaps são reais: o prazo de 2027 do Bing, a transparência em nível de URL faltando do Apple e do Google, e o problema completamente não resolvido dos AI Summaries.

Se você opera um site de conteúdo, a ação imediata é simples: verifique suas configurações migradas e, se você monetiza com anúncio, garanta que Disallow AI Training está ligado. Se você constrói em cima de dados de crawler, comece a projetar para um mundo onde acesso de treinamento é opt-in, não padrão.

Este conteúdo foi elaborado com o auxílio de ferramentas de IA, com base em fontes confiáveis, e revisado pela nossa equipe editorial antes da publicação. Não substitui o aconselhamento de um profissional especializado.