A Cloudflare anunciou em 15 de setembro de 2026 uma configuração para permitir que proprietários de sites restrinjam o uso de seus conteúdos no treinamento de modelos de inteligência artificial sem, necessariamente, impedir a presença dessas páginas nos mecanismos de busca. Batizado de “Disallow AI Training”, o recurso tenta separar finalidades que muitas vezes são atendidas pelos mesmos rastreadores.
O problema ganhou importância com a expansão dos sistemas de IA generativa. Um site pode querer aparecer nos resultados de pesquisa para receber tráfego orgânico, mas não desejar que seus textos, imagens ou outros materiais sejam coletados para treinar modelos. Quando um mesmo robô desempenha as duas funções, bloquear todo o acesso pode reduzir a possibilidade de descoberta da página pelos usuários.
Segundo o anúncio publicado no blog da Cloudflare, a nova proposta organiza o tráfego automatizado em três categorias: “Search”, associada à indexação para mecanismos de busca; “Training”, relacionada ao treinamento ou ajuste de modelos; e “Agent”, voltada a agentes que acessam páginas em nome de usuários.
Como funciona a separação entre busca e treinamento
A configuração publica uma preferência no arquivo robots.txt, utilizado por sites para comunicar aos rastreadores quais áreas podem ou não ser acessadas. A lógica apresentada pela Cloudflare é permitir que rastreadores considerados responsáveis continuem consultando o conteúdo para fins de busca, enquanto o uso destinado ao treinamento de modelos seja restringido.
Na prática, a medida depende de os rastreadores identificarem corretamente sua finalidade e respeitarem a indicação registrada pelo site. Por isso, a iniciativa não deve ser interpretada como uma barreira técnica capaz de impedir, por si só, qualquer coleta não autorizada. Ela funciona como uma política de preferência e como uma forma de tornar mais explícita a finalidade declarada por cada tipo de acesso automatizado.
A própria Cloudflare apresenta o recurso como uma resposta ao cenário de “rastreadores de uso misto”, que podem ser empregados tanto para indexar páginas quanto para coletar dados destinados ao desenvolvimento de produtos de inteligência artificial. A empresa também informou que Apple, Google e Microsoft assumiram compromissos ou oferecem mecanismos relacionados ao controle do uso de conteúdos por sistemas de IA.
Google diferencia rastreamento de busca e uso em IA
A documentação do Google for Developers ajuda a esclarecer a diferença entre bloquear o rastreador de busca e controlar determinados usos em produtos de inteligência artificial. O Google-Extended pode ser configurado para limitar o uso de conteúdos no treinamento de modelos Gemini, sem afetar a inclusão ou o ranqueamento das páginas no Google Search.
Esse mecanismo não equivale ao bloqueio do Googlebot. De acordo com as orientações do Google Search Central, impedir o acesso do Googlebot pode ter impacto na aparição de uma página nos resultados de busca. Já o Google-Extended é uma configuração separada, voltada a usos específicos do conteúdo em produtos de IA.
A distinção é relevante para portais jornalísticos, empresas, produtores independentes e administradores de sites no Brasil. Ao decidir como configurar seus arquivos e políticas de rastreamento, esses grupos precisam considerar objetivos diferentes: ser encontrado em buscadores, permitir respostas de agentes em nome dos usuários e autorizar ou não a utilização do material no treinamento de modelos.
Medida não cria um padrão universal
Apesar de propor uma classificação mais detalhada, o “Disallow AI Training” é uma iniciativa da Cloudflare, e não um padrão universal já adotado por toda a internet. A eficácia da separação depende da identificação dos rastreadores, da transparência das empresas que os operam e do cumprimento das preferências publicadas pelos sites.
O debate também envolve usos distintos que podem ser confundidos. Rastreamento é o acesso automatizado a uma página; indexação é a organização desse conteúdo para permitir sua localização em um buscador; treinamento é a utilização de dados para desenvolver ou ajustar modelos; e agentes podem consultar páginas para executar tarefas solicitadas por usuários. Cada finalidade pode exigir uma política diferente.
Para gestores de sites, a novidade reforça a necessidade de acompanhar quais robôs acessam seus domínios e para que finalidade. A decisão entre liberar, restringir ou separar esses acessos pode afetar a visibilidade, a circulação do conteúdo e a relação com plataformas de inteligência artificial. A proposta da Cloudflare, portanto, amplia as opções de controle, mas não elimina a disputa por transparência e responsabilidade no uso de informações publicadas na internet.
