Cloudflare separa pesquisa, treinamento e agentes de IA. O que as marcas precisam saber
A Cloudflare substituiu seus controles de bot de IA genéricos por configurações separadas para pesquisa, treinamento e agentes. Veja o que a mudança significa para a visibilidade de busca, citações de IA e estratégia de crawler.
Em 15 de setembro de 2026, a Cloudflare mudou a forma como os proprietários de sites controlam os crawlers de IA. A mudança importante não é apenas que há mais configurações. É que a Cloudflare agora trata pesquisa, treinamento de modelo e agentes de IA como comportamentos diferentes.
Para as marcas, essa distinção importa. Um site pode querer permanecer detectável na pesquisa e em respostas geradas por IA sem dar a todo crawler permissão para usar seu conteúdo para treinamento de modelo. Até agora, esses objetivos podiam ser difíceis de separar quando um único crawler servia a mais de um propósito.
Os novos controles da Cloudflare são projetados para tornar essa escolha mais precisa.
O que a Cloudflare mudou
A Cloudflare agora agrupa a atividade de crawler relacionada à IA em três comportamentos.
Pesquisa abrange crawlers que constroem um índice para que o conteúdo possa ser encontrado posteriormente. Treinamento abrange crawlers usados para treinar ou refinar modelos. Agente abrange sistemas direcionados pelo usuário que visitam uma página em tempo real em nome de uma pessoa, como bots de busca de chat e agentes de uso de navegador.
A empresa também está descontinuando seu controle antigo Block AI Bots em favor dessas configurações mais granulares. A Cloudflare diz que as preferências existentes dos clientes serão migradas automaticamente para os novos controles de Pesquisa, Treinamento e Agente. Sua documentação explica as opções de política atualizadas aqui.
A maior adição é uma configuração chamada Disallow AI Training. Ela é destinada a sites que desejam expressar uma preferência de não treinamento sem se removerem desnecessariamente da descoberta de pesquisa.
Isso soa como uma mudança de infraestrutura sutil. Na prática, resolve um problema cada vez mais importante para as marcas.
Por que a antiga abordagem de "bloquear IA" era muito genérica
Alguns crawlers são de propósito único. Outros são de propósito misto e podem suportar tanto a pesquisa convencional quanto os usos relacionados à IA.
A Cloudflare identifica especificamente Applebot, Bingbot e Googlebot como crawlers de uso misto. Sob os controles atualizados, escolher Bloquear para treinamento pode agora bloquear esses crawlers completamente, incluindo sua função de pesquisa. Isso significa que uma decisão tomada para restringir o treinamento de IA também poderia afetar a detectabilidade de pesquisa comum.
A nova opção Disallow AI Training da Cloudflare foi projetada para evitar essa troca para operadores de crawler que suportam uma preferência separada de não treinamento.
A demanda por essa distinção já é visível nos próprios dados da Cloudflare. A empresa afirma que menos de 1% dos sites da Cloudflare optam por bloquear bots de Pesquisa, enquanto 17% usam algum mecanismo para bloquear o Treinamento. Em outras palavras, a maioria dos proprietários de sites parece ver a descoberta e o treinamento de modelo como duas decisões diferentes. A Cloudflare publicou os números em seu anúncio de 15 de setembro.
Para equipes de marketing, SEO e conteúdo, essa é a principal conclusão: "Este sistema pode encontrar nosso conteúdo?" e "Esta empresa pode treinar com nosso conteúdo?" não são mais a mesma pergunta.
Pesquisa, treinamento e agentes são três decisões diferentes
O valor prático do modelo da Cloudflare é que ele força os proprietários de sites a pensar no acesso do crawler por propósito, em vez de por uma categoria vaga chamada "bots de IA".
Um crawler de pesquisa pode indexar uma página de produto para que ela possa aparecer posteriormente nos resultados de pesquisa. Um crawler de treinamento pode coletar a mesma página como parte de um conjunto de dados usado para melhorar um modelo. Um agente pode buscar a página no momento em que um usuário pede para comparar produtos, verificar a disponibilidade ou resumir informações.
Essas atividades podem tocar na mesma URL, mas as implicações comerciais são diferentes.
Para muitas marcas, a descoberta por pesquisa é desejável. O acesso por agente também pode ser desejável quando ajuda um cliente a pesquisar ou interagir com o negócio. O treinamento de modelo é uma questão de política separada que envolve direitos de conteúdo, valor comercial e preferência organizacional.
A Cloudflare está efetivamente dando aos proprietários de sites uma superfície de controle mais clara para essas escolhas.
O que "Disallow AI Training" realmente faz
A Cloudflare diz que a nova configuração usa Bot Preference Sync para publicar uma preferência apropriada de não treinamento em robots.txt enquanto permite que crawlers de uso misto reconhecidos continuem operando para pesquisa.
Para crawlers exclusivos de treinamento operados por empresas como Amazon, Anthropic, Meta e OpenAI, a Cloudflare diz que pode bloquear o crawler de treinamento sem afetar um crawler de pesquisa separado onde o operador separa essas funções.
Apple e Google já fornecem mecanismos que distinguem a pesquisa do treinamento de IA. A Apple usa Applebot-Extended, enquanto o Google usa Google-Extended. Ambas as empresas afirmam que optar por não usar esses usos estendidos não afeta o ranking de pesquisa convencional.
A Microsoft é ligeiramente diferente. A Cloudflare diz que a Microsoft está trabalhando em uma preferência de não treinamento em nível de domínio no robots.txt, com previsão para o início de 2027. Até que esse suporte esteja disponível, a Cloudflare observa que selecionar Disallow AI Training não comunicará automaticamente uma preferência de não treinamento ao Bing por meio do robots.txt. A Microsoft atualmente fornece outros controles, incluindo seu mecanismo NOARCHIVE e Webmaster Tools.
Essa nuance é importante. Disallow AI Training não é um protocolo universal que todo crawler interpreta de forma idêntica hoje. É uma camada de controle que combina a classificação e aplicação da Cloudflare com as preferências suportadas por operadores de crawler individuais.
robots.txt é uma preferência, não um limite de segurança
Há outra distinção que as marcas devem entender.
Um arquivo robots.txt diz a um crawler o que o proprietário de um site deseja que ele faça. Não impede, por si só, tecnicamente o acesso. A própria documentação da Cloudflare é explícita que a conformidade com robots.txt é voluntária.
A Cloudflare pode adicionar uma camada de aplicação porque ela fica na frente do site. Seu produto AI Crawl Control pode identificar o tráfego de crawler e permitir, bloquear ou gerenciar de outra forma de acordo com a configuração do site. A Cloudflare documenta a diferença entre as preferências do robots.txt e os controles de crawler aplicados aqui.
Para equipes que revisam sua estratégia de crawler de IA, isso significa que há duas perguntas a fazer: que preferência o site publica e qual acesso está realmente sendo aplicado?
Acesso do crawler não é o mesmo que visibilidade de IA
É aqui que a conversa se torna particularmente relevante para marcas que medem a pesquisa de IA.
Permitir que um crawler acesse seu site não garante que o ChatGPT, Gemini, Perplexity, Claude ou outro motor de resposta mencionará, recomendará ou citará sua marca. A rastreabilidade é infraestrutura. A visibilidade é um resultado.
Da mesma forma, bloquear um determinado crawler de treinamento não significa necessariamente que uma marca desaparecerá das respostas geradas por IA. Um motor ainda pode encontrar informações por meio de um índice de pesquisa, recuperar uma página usando um crawler separado, citar uma fonte de terceiros ou obter informações adquiridas por outros canais permitidos.
Uma maneira útil de pensar sobre a sequência é:
Acessível -> detectável -> recuperável -> citado -> recomendado.
Os controles do crawler influenciam os primeiros estágios. Eles não determinam a resposta final.
É por isso que a configuração técnica do crawler deve ser considerada juntamente com o rastreamento de visibilidade de IA, a análise de citações e a influência da fonte. A questão prática para uma equipe de marketing não é apenas se um bot de IA pode alcançar o site. É se a marca realmente aparece quando clientes em potencial fazem perguntas relevantes.
O que as marcas que usam Cloudflare devem verificar agora
- Revise as novas configurações de Pesquisa, Treinamento e Agente. Não presuma que a antiga configuração Bloquear Bots de IA mapeia para a política que sua organização deseja hoje.
- Decida sobre cada comportamento separadamente. A detectabilidade na pesquisa, o treinamento de IA e o acesso por agente têm diferentes implicações comerciais.
- Use Disallow AI Training cuidadosamente se seu objetivo for "pesquisa sim, treinamento não". Uma configuração de Bloqueio total pode afetar crawlers de uso misto como Googlebot, Applebot e Bingbot.
- Revise tanto
robots.txtquanto as regras de crawler aplicadas. Uma preferência publicada e um bloqueio em nível de rede não são a mesma coisa. - Verifique o resultado, não apenas a configuração. Verifique se as páginas importantes permanecem acessíveis e, em seguida, monitore se sua marca continua a ser mencionada e citada nas respostas de IA que importam para seus clientes.
Citations.io também tem um verificador de crawler de IA gratuito que pode ajudar as equipes a inspecionar como um site atualmente lida com agentes de usuário comuns de crawlers de IA.
O que isso significa para AEO e estratégia de pesquisa de IA
As bases técnicas da visibilidade de pesquisa estão se tornando mais granulares.
As equipes tradicionais de SEO estão acostumadas a pensar em Googlebot, indexabilidade e robots.txt. A pesquisa de IA adiciona novas camadas: crawlers de treinamento, crawlers de recuperação, agentes acionados pelo usuário e comportamento de citação em nível de fonte.
O resultado não é que toda marca deve simplesmente permitir todo crawler. A melhor abordagem é tomar uma decisão intencional sobre cada caso de uso e, em seguida, medir as consequências.
Para organizações que trabalham com otimização de mecanismos de resposta ou otimização de mecanismos generativos, a política de crawler agora deve estar ao lado da qualidade do conteúdo, acessibilidade técnica, dados estruturados, autoridade de terceiros e estratégia de citação.
Uma política de crawler perfeitamente configurada não pode fazer com que um mecanismo de resposta recomende uma marca. Mas uma política acidentalmente restritiva pode remover uma rota importante pela qual o conteúdo é descoberto ou recuperado.
A mudança maior: controle e visibilidade estão se separando
A atualização da Cloudflare reflete uma mudança mais ampla na forma como a web interage com os sistemas de IA.
Os proprietários de sites precisam cada vez mais de controles que distingam entre ser encontrado, ser usado e ser acionado. Pesquisa, treinamento e agentes representam três relacionamentos diferentes entre um site e um sistema automatizado.
Para as marcas, a oportunidade estratégica é parar de tratar o "acesso à IA" como uma única decisão de ligar/desligar.
Decida onde a descoberta cria valor. Decida onde o treinamento é aceitável. Decida como os agentes devem interagir com suas páginas. Em seguida, meça o que realmente acontece nas respostas geradas.
Citations.io rastreia como ChatGPT, Gemini, Perplexity e Claude mencionam, classificam e citam marcas em respostas geradas por IA. A configuração do crawler é uma parte desse cenário. O resultado é se sua marca está visível quando importa.
Nota da fonte: Este artigo é baseado no anúncio de 15 de setembro de 2026 da Cloudflare, em sua documentação de política de crawler de IA e em sua documentação de AI Crawl Control. As políticas de crawler e o suporte do operador podem mudar, então as equipes técnicas devem verificar a documentação atual antes de fazer alterações na produção.

