A Cloudflare anunciou em 15 de setembro de 2026 uma mudança para separar melhor o que sites permitem a crawlers de IA. A proposta, descrita no blog da empresa, tenta resolver uma tensão crescente: muitos publicadores querem aparecer em mecanismos de busca, mas não querem que o mesmo acesso seja usado automaticamente para treinar modelos.
O problema não é novo, mas ficou mais urgente com sistemas de IA que misturam indexação, respostas resumidas e coleta de conteúdo. O mesmo robô pode visitar uma página para viabilizar descoberta em busca, alimentar respostas de assistentes ou contribuir para treinamento. Para o dono do site, essas finalidades têm impactos diferentes.
Busca não é treino
A mudança da Cloudflare parte de uma distinção prática. Indexação de busca serve para descoberta: o conteúdo aparece em resultados e pode levar visitantes ao site. Treino de modelos usa o conteúdo como dado para melhorar ou adaptar sistemas de IA. Em um caso, o site tende a receber tráfego. No outro, o valor pode ser absorvido por uma plataforma sem retorno direto ao publicador.
Ao separar esses usos, a Cloudflare tenta dar aos administradores um controle mais granular sobre crawlers de IA. O site pode permitir indexação para busca e restringir uso em treinamento. A empresa citou que Apple, Google e Microsoft honram ou se comprometeram a honrar esse tipo de sinalização, embora nem todos os mecanismos estejam completos ao mesmo tempo.
A própria Cloudflare observou uma limitação importante: para o Bing, a Microsoft ainda trabalhava em um mecanismo para respeitar uma diretiva de não treinamento em robots.txt até o começo de 2027. Enquanto isso, controles existentes, como NOARCHIVE, continuam tendo papel próprio e não substituem uma política específica para treino.
O que muda para administradores
Para quem opera sites, a decisão deixa de ser binária. Bloquear todos os robôs pode proteger conteúdo, mas também reduz descoberta. Liberar tudo mantém visibilidade, mas pode permitir usos indesejados em IA. A separação proposta para crawlers de IA permite documentar melhor a intenção do site.
Isso também ajuda equipes jurídicas, editoriais e técnicas a conversarem usando a mesma base. A política de robots.txt e as configurações no provedor de borda deixam de ser um detalhe apenas técnico. Elas passam a refletir uma decisão de negócio sobre distribuição, licenciamento e sustentabilidade de conteúdo.
Por que publicadores acompanham isso
O anúncio toca em uma questão maior: quem captura valor quando conteúdo da web alimenta respostas de IA. Resumos automáticos podem resolver a dúvida do usuário sem gerar clique. Treinamento pode melhorar modelos sem remunerar o produtor original. Ao mesmo tempo, estar ausente de busca ainda pode ser caro para qualquer site dependente de descoberta.
A separação de crawlers de IA não resolve sozinha compensação, licenciamento ou transparência. Ela cria uma camada operacional mais clara para expressar preferências e cobrar respeito a elas. Para blogs, veículos e bases de conhecimento, esse tipo de controle tende a virar parte normal da governança técnica do site.
Na prática, a recomendação para equipes é revisar robots.txt, configurações de Cloudflare e políticas internas de uso de conteúdo. O tema saiu do campo abstrato da IA generativa e entrou na rotina de administração da web.