1 pontos por GN⁺ 3 시간 전 | 1 comentários | Compartilhar no WhatsApp
  • Clientes de todos os planos agora podem permitir ou bloquear tráfego automatizado dividido em Search·Agent·Training, possibilitando políticas mais granulares do que o bloqueio genérico anterior de bots de IA
  • O critério de classificação não é se usa IA ou não, mas sim o comportamento e o uso do conteúdo no site; para crawlers multipropósito, todas as regras relevantes são aplicadas, e a empresa recomenda separar crawlers por finalidade
  • A partir de 15 de setembro de 2026, em páginas com anúncios de novos domínios, Training e Agent serão bloqueados por padrão e Search será permitido; para crawlers multipropósito como Googlebot, Applebot e BingBot, valerá a regra mais restritiva
  • No BotBase do Enterprise Bot Management, será possível pesquisar classificações e IDs de detecção de bots e agentes conhecidos; também foram introduzidos os níveis de uso de conteúdo immediate, reference e full, além do sinal use no robots.txt
  • Verified não significa mais permissão automática; a empresa quer usar confiança transitiva com o header Forwarded da RFC 7239 para transmitir, além das camadas intermediárias, quem é o operador e como o conteúdo será usado

Por que controlar o tráfego de IA por finalidade

  • No passado, o rastreamento da web coletava conteúdo dos sites em troca de tráfego vindo de busca, mas o treinamento de IA passou a levar o conteúdo sem devolver valor aos proprietários dos sites
  • Há um ano, a Cloudflare lançou a opção de um clique Block AI Bots e o Pay-Per-Crawl marketplace
  • Proprietários de conteúdo querem proteger o original e ser remunerados, mas bloquear toda automação de forma indiscriminada não atende bem a essas necessidades
  • Sites pequenos podem acabar tendo de permitir até treinamento de IA para ganhar visibilidade em buscas, ou então bloquear o treinamento e perder capacidade de descoberta
    • Isso favorece operadores de busca já estabelecidos, que usam o mesmo bot para busca e treinamento
    • Para novos concorrentes que tentam reduzir essa diferença, surge o incentivo para evitar detecção
  • Com o surgimento de serviços como a Busca do Google, que entregam respostas diretamente na página de resultados, torna-se mais importante saber o que o bot faz, armazena e redistribui do que se ele é “de IA” ou não

Classificação Search·Agent·Training

  • A empresa divide em três categorias os casos de uso centrados em IA que todos os clientes podem gerenciar
    • Search: coleta ou indexa conteúdo antecipadamente para responder perguntas depois; o proprietário do site pode esperar tráfego de referência ou compensação equivalente
    • Agent: executa tarefas em tempo real no lugar de uma pessoa; inclui bots de coleta em chats como o ChatGPT-User e agentes de navegador como Gemini e Claude operando o Chrome
    • Training: leva conteúdo para treinar ou ajustar modelos; os dados são absorvidos permanentemente pela infraestrutura baseada em IA e usados para melhorar desempenho
  • Como um mesmo crawler pode ter múltiplas finalidades, a Cloudflare rastreia todas as classificações aplicáveis ao mesmo tempo
  • Para operadores que fazem indexação para busca, tarefas de agente e treinamento de modelos, a recomendação é separar isso em três crawlers distintos por finalidade, deixando claro o objetivo da visita e o nível de acesso
  • Outros comportamentos automatizados, como verificação de anúncios, coleta de feeds e transações por agentes, também são classificados separadamente, mas as funções diretamente gerenciáveis por todos os donos de sites são Search·Agent·Training

Controles para todos os planos e novos padrões

  • O preset antigo Block AI Bots bloqueava principalmente bots de finalidade única para treinamento de modelos, mas a nova configuração oferece controle por Search·Agent·Training até no plano Free
  • A partir de 15 de setembro de 2026, os seguintes padrões serão aplicados a páginas com anúncios de domínios recém-registrados na Cloudflare
    • Training e Agent serão bloqueados por padrão
    • Search será permitido por padrão
  • Como anúncios são um sinal de monetização pensado para que pessoas visitem e vejam a página, Training e Agent são bloqueados por poderem interromper essa atenção humana
  • Search fica liberado por padrão por ser o comportamento mais próximo de direcionar visitantes ao site
  • Para crawlers multipropósito que fazem Search e Training ao mesmo tempo, a regra mais restritiva tem prioridade
    • Para clientes que escolherem bloquear Training, Googlebot, Applebot e BingBot também serão bloqueados
    • Isso vale tanto para a nova opção de gerenciamento de tráfego de IA quanto para o serviço Block AI Bots existente
  • Clientes atuais podem recusar a mudança antes de 15 de setembro em Security settings, mantendo a configuração anterior para crawlers de Training que também fazem Search

Visibilidade de bots e classificação de comportamento com o BotBase

  • O BotBase adicionado ao Enterprise Bot Management é um banco de dados pesquisável de tráfego automatizado conhecido, incluindo bots e agentes Verified
  • No painel da Cloudflare, é possível ver a lista completa de bots e agentes Verified e a nova classificação
    • É possível filtrar o tráfego de um bot específico
    • É possível copiar o ID de detecção para usar em regras de Security
    • A tela dedicada pode ser acessada no Bot Management configuration card
  • Inicialmente o foco é em visibilidade, e no fim de 2026 a empresa pretende expandir isso para um centro de controle de conteúdo automatizado conhecido no site
  • O BotBase atribui uma ou mais categorias a cada bot com base nos comportamentos que ele pode executar no site
    • Search: rastreamento para exibição em resultados de busca
    • Agent: agente que visita páginas seguindo instruções humanas
    • Training: rastreamento para treinamento ou fine-tuning de modelos
    • Transact: execução de pagamentos em nome do usuário
    • Data Collection: coleta de preços, inteligência competitiva e análise por terceiros
    • Security Testing: varredura de vulnerabilidades e testes de intrusão
    • SEO: crawling de SEO, auditoria de sites e verificação de acessibilidade
    • Ads Verification: verificação de posicionamento de anúncios e detecção de fraude publicitária
    • Social / Link Preview: pré-visualização de links em plataformas sociais e apps de mensagens
    • Feed Fetching: leitores de RSS, agregadores de podcasts e bots de feed de notícias
    • Monitoring & Operations: monitoramento de uptime, webhooks e verificações de status

Níveis de uso de conteúdo e sinais no robots.txt

  • A Cloudflare está desenvolvendo uma função para gerenciar, por nível de uso de conteúdo (content use), como bots armazenam e reutilizam o conteúdo coletado
    • immediate: apenas interage, sem armazenar ou reutilizar
    • reference: indexa e cita trechos, com link para o original; é o padrão
    • full: pode resumir e reproduzir o conteúdo
  • Ao combinar classificação do bot com nível de uso de conteúdo, é possível criar políticas como “permitir Search·SEO·Ads Verification, mas apenas até reference
  • Em vez de criar regras para cada bot individualmente, o acesso pode ser decidido por grupos de comportamento
  • Também está sendo testado no robots.txt o sinal use, que expande o Content Signals
    • use=immediate
    • use=reference
    • use=full
  • O valor de uso de conteúdo no robots.txt não aplica bloqueio diretamente; ele comunica a preferência do proprietário do site
  • Para clientes que já usavam search=yes,ai-train=no no robots.txt gerenciado, será adicionado use=reference
User-agent: *
Content-Signal: search=yes,ai-train=no,use=reference
Allow: /
  • O BotBase também rastreia como cada bot usa o conteúdo; bots que abusarem do sinal perderão o status Verified e deixarão de ser permitidos
  • Bots que reproduzem integralmente o conteúdo atualmente não podem receber status Verified

O novo significado de Verified

  • No passado, todos os bots Verified eram permitidos por padrão, e esse critério estava refletido no Bot Fight Mode e nos templates de regra do Enterprise Bot Management
  • Agora, bots não verificados continuam bloqueados por padrão, mas bots Verified também não são mais permitidos automaticamente
  • Verified agora significa que o bot é aceitável na categoria relevante; o acesso real depende de a categoria correspondente, como Search, estar liberada
  • Para obter status Verified, o operador do bot precisa cumprir duas condições
    • Identificar honestamente sua própria identidade
    • Não abusar do acesso obtido com base nessa honestidade
  • A Cloudflare também está desenvolvendo ferramentas para operadores de bots poderem gerenciar se estão refletidos corretamente na classificação da empresa

Confiança transitiva ao passar por plataformas intermediárias

  • Automação e agentes nem sempre são operados diretamente pela empresa que os criou; uma única plataforma de desenvolvimento pode executar requisições em nome de milhares de operadores, de empresas a desenvolvedores individuais
  • A relação site proprietário → empresa dona do bot → usuário final é definida como confiança transitiva (transitive trust)
  • A empresa propõe usar o header Forwarded da RFC 7239 para incluir na requisição a informação do operador, que normalmente se perde no processo de proxy
Forwarded: for="openai"
  • O nível de uso do conteúdo também pode ser transmitido junto
Forwarded: for="openai";use="reference"
  • Se um site permitir um operador específico, a mesma política pode ser mantida para requisições que chegam por várias camadas intermediárias confiáveis; o formato detalhado pode ser consultado na documentação de autenticação de web bots
  • Como domínios web atrás da Cloudflare representam mais de 20% do total, perder o status de confiança pode ser um mecanismo real de dissuasão para operadores
  • Quando há mistura de tráfego de bots e humano, a confiança transitiva pode se aplicar apenas a usuários que podem revelar sua identidade
    • Fontes pequenas de tráfego precisam de proteção de privacidade
    • Empresas que queiram cumprir compromissos de privacidade precisam de componentes alternativos, como private rate limiting

Estado de disponibilidade e princípios operacionais

  • As novas opções de tráfego de IA já estão disponíveis para todos os clientes existentes e podem ser configuradas em zone Settings
  • Os novos padrões e o sistema de classificação buscam colocar nas mãos do proprietário do site a decisão sobre quem usa o conteúdo e de que forma, ao mesmo tempo em que operadores de automação ganham mais acesso quanto mais transparentes forem sobre seu propósito
  • As políticas detalhadas continuarão sendo ajustadas conforme a web e o tráfego automatizado evoluírem, mas o princípio de colocar a escolha e a confiança dos criadores de conteúdo no centro será mantido

1 comentários

 
GN⁺ 3 시간 전
Comentários do Hacker News
  • O Googlebot usa a mesma infraestrutura de crawler para indexação de busca e treinamento do Gemini, então desde 15 de setembro ele passa a ser afetado pela política de “bloqueio de treinamento” da Cloudflare
    Como a regra mais restritiva tem prioridade, em sites de clientes que bloqueiam treinamento, crawlers multipropósito como Googlebot, Applebot e BingBot também são bloqueados

    • A forma como o Google obriga donos de sites a aceitar treinamento de IA ou sair da busca parece predatória, injusta e ilegal
      Como é justamente esse tipo de conduta de uma empresa com monopólio em busca que as leis antitruste devem impedir, espero que ao menos os reguladores da UE intervenham, e todo registro de rastreamento do Googlebot nos logs de acesso pode servir de base para indenização por danos
    • Só descobri que o Googlebot também era usado para treinamento de IA depois que ele começou a despejar requisições aleatórias nos sistemas do cliente, quase causando indisponibilidade
      Foi frustrante não conseguir nem encontrar na busca uma forma correta de recusar esse uso do conteúdo pelo Google
    • Isso parece uma ameaça enviada a empresas que recusam o roubo de conteúdo
    • Usuários usam busca de alguma forma, e alguém precisa indexar páginas, seja um modelo de linguagem de grande escala ou um mecanismo de busca tradicional
  • Em domínios novos, a postura da Cloudflare de bloquear por padrão treinamento e crawling de agentes em páginas com anúncios, enquanto permite busca, cansa por parecer que ela está dos dois lados da corrida armamentista
    Por um lado fornece tecnologia para criar agentes e produtos de IA, e por outro promove políticas como essa, o que dificulta confiar de imediato na empresa
    Também surpreende vê-la apresentar de forma positiva o poder de conceder ou retirar uma “posição de confiança” com base em mais de 20% dos domínios da web

    • Não parece justo dizer que ela está dos dois lados. Pelo que entendo, os produtos de scraping da Cloudflare também tentam fazer isso funcionar de forma controlada, sem derrubar sistemas
    • Parece que querem criar um caminho intermediário que não permita crawling ilimitado nem bloqueie tudo, oferecendo ferramentas para que produtores e consumidores negociem com base em permissão e compensação
  • Gostaria que considerassem adotar prova de trabalho (PoW) como o Anubis em vez dos recursos da Cloudflare
    Está cada vez mais comum ser totalmente bloqueado em sites protegidos pela Cloudflare sem nem aparecer CAPTCHA, e mesmo que cada site individualmente não seja importante, é deprimente ver esse tipo de escolha corroer a base da internet

    • Provas de trabalho como o Anubis não funcionam. Bots estão usando cada vez mais navegadores headless para resolver CAPTCHA e prova de trabalho e contornar quase todos os bloqueios, então está ficando difícil impedir que tráfego indesejado bata em sites e serviços
    • Peço que não usem Anubis, porque em hardware antigo e smartphones baratos ele pode fazer o acesso ao site demorar vários minutos
    • A menos que você esteja navegando com a string de user-agent do Googlebot, em vez de bloqueio total no máximo deveria aparecer um desafio do Turnstile, o que não é tão diferente de um desafio do Anubis
      Se houve bloqueio total, é mais provável que tenha sido uma decisão do site de bloquear todas as VPNs ou usuários fora de certos países, e não algo da própria Cloudflare
    • Em vez de desperdiçar computação com prova de trabalho, não seria melhor minerar Monero?
    • Link do GitHub para quem tiver curiosidade: https://github.com/techaroHQ/anubis
  • É preocupante entregar voluntariamente a uma única empresa cada vez mais dominante o controle de quem pode acessar um site
    Bloquear por reflexo “bots” e “IA” também impede o acesso de agentes de IA que trabalham em nome do usuário, então a premissa da política já está errada

  • Não está claro qual é o resultado final que a Cloudflare e a web querem. Anthropic, DeepMind, OpenAI e Google provavelmente não vão pagar custos de crawling, e é mais provável que fechem acordos privados com grandes fornecedores de debate, como o Reddit
    Recursos que trazem informações novas para o contexto vão continuar, mas isso é diferente de scraping indiscriminado

    • Ninguém sabe qual será o próximo resultado. O equilíbrio anterior em torno da coleta de conteúdo por mecanismos de busca já era desconfortável, mas dizer que bots de IA só levam e não devolvem nada não é exagero, é a situação atual
      Se o Google conseguir avançar na direção de responder perguntas diretamente e quase ninguém mais ir ao site original, o valor econômico de publicar conteúdo na web desaparece de forma ampla. Se continuar assim, o Google acabará bloqueado técnica e legalmente e não conseguirá obter conteúdo, e todos sairão perdendo
      Nem um mundo em que todos trabalham de graça para que Google e motores de IA capturem o valor, nem um mundo em que a produção de conteúdo para completamente, é sustentável, mas ainda existe a possibilidade de quase todo conteúdo acabar atrás de paywall
      Só que micropagamentos fracassaram completamente até agora, e se não houver uma forma de reduzir atrito o suficiente, a maior parte do conteúdo valioso pode ficar trancada, elevando os custos de descoberta e acesso e encolhendo fortemente toda a indústria de conteúdo. Se só restarem pagamentos em valores altos, a web comercial ficará muito menor e talvez de maior qualidade, mas com um preço considerável
    • Tenho sentimentos mistos sobre a Cloudflare tomar unilateralmente decisões que afetam o fluxo de tráfego de toda a internet
      Independentemente de liderar ou não, decisões assim exigem participação direta da IETF para considerar todos os envolvidos, caso contrário a internet pode se fragmentar
    • A Cloudflare parece querer se tornar a cobradora universal de impostos da internet, arrecadando 1 penny por acesso a página
      Grandes empresas estabelecidas provavelmente até gostariam disso, porque conseguem arcar com o custo enquanto erguem uma enorme barreira financeira para novos entrantes
    • As opções são pagar ou morrer, e a Cloudflare vai cobrar pedágio com prazer. A Apple também já cobra esse tipo de imposto ao receber 20 bilhões de dólares por ano do Google
      Os próprios clientes da Cloudflare provavelmente não vão se importar com a forma como a empresa trata as principais empresas de IA, desde que recebam sua parte por meio de serviços gratuitos ou baratos
  • Queria saber se dá para configurar para permitir apenas Google, OpenAI, Grok, Claude e Perplexity e bloquear o restante dos bots
    Hoje só o Google realmente envia visitantes, mas outros grandes serviços de IA talvez passem a enviar no futuro
    Bloquear “bots anônimos” também pode ser uma alternativa. Depois do aumento dos bots de IA, tenho sofrido muito com enormes volumes de requisições vindas de IPs residenciais fingindo ser pessoas reais, e esse tráfego só gera custo sem receita
    Também queria saber se a Amazon CloudFront tem algum recurso para ajudar nisso

    • O Google agora está se movendo ativamente para não enviar visitantes aos sites
  • Sou grato à Cloudflare por ser uma das poucas plataformas que permite aos sites escolher como se relacionar com IA e até oferece formas de monetizar o tráfego de IA

  • Queria saber se há alguma novidade sobre o programa de cobrança por crawling

  • Testei bloquear treinamento de IA e isso também bloqueou o bot de busca do Google, reduzindo o tráfego pela metade, então não recomendo

  • Fico pensando se alguém realmente usa esse tipo de recurso. Também duvido que scrapers vão pagar e, mesmo que paguem, sou cético de que paguem o suficiente para valer a pena