1 pontos por GN⁺ 2 시간 전 | 1 comentários | Compartilhar no WhatsApp
  • Muitos casos de Googlebot que enviam solicitações a ponto de causar indisponibilidade em sites não vêm do Google, mas de bots externos se passando pelo Googlebot
  • O User-Agent HTTP pode ser definido arbitrariamente por quem faz a solicitação, portanto a string Googlebot/2.1 nos logs não garante que seja o Googlebot real
  • Bots impostores usam o nome Googlebot para contornar bloqueios, e também podem fazer parte de uma única campanha maliciosa de crawling em larga escala que utiliza servidores de vários provedores de hospedagem
  • Para verificar se é o Googlebot real, é preciso usar o comando host ou os intervalos de IP publicados pelo Google; mesmo IPs registrados em nome da Google LLC podem ser endereços do Google Cloud, então é necessária verificação adicional
  • Não há dados de que a maioria de todo o tráfego do Googlebot seja falsa, mas o tráfego de Googlebot que prejudica serviços parece vir principalmente de bots impostores

Equívocos sobre o tráfego do Googlebot

  • Há reclamações de operadores de que o crawler da Busca Google causa indisponibilidade em sites por tráfego excessivo ou se comporta como um DDoS
  • No entanto, esse tráfego destrutivo pode não vir do Google, mas de outros agentes enviando solicitações impostoras usando indevidamente o nome Googlebot
  • Encontrar a string Googlebot nos logs do servidor não é suficiente para concluir que o Google é a origem do tráfego

User-Agent não é prova de identidade

  • Solicitações que parecem vir do Googlebot normalmente incluem um valor como este
  • Logs do nginx também podem registrar a mesma string, mas o cabeçalho User-Agent pode ser configurado livremente com qualquer valor por quem faz a solicitação
  • O User-Agent é uma autoidentificação voluntária, não uma credencial autenticada, portanto qualquer um pode alegar ser o Googlebot

Origem e escala dos bots impostores

  • Os agentes impostores parecem usar o User-Agent do Googlebot para contornar bloqueios de bots existentes
  • O IP do log de exemplo foi identificado como um servidor fornecido pela empresa de hospedagem Virtual Machine Solutions LLC, não pelo Google
  • A falsificação do Googlebot é uma técnica comum há muito tempo, e recentemente foi observado que sua escala aumentou
  • Chris Siebenmann sugere que, em vez de uma técnica antiga ter se popularizado simultaneamente em vários lugares, pode se tratar de uma campanha em larga escala de um único crawler malicioso que obteve muitos servidores em diversos provedores de hospedagem

Como verificar o Googlebot real

  • Conforme a documentação do Google para verificar o Googlebot, é possível executar o comando host algumas vezes ou comparar com os intervalos de IP publicados pelo Google
  • A maioria dos principais crawlers publica listas de IPs, mas o formato específico e o modo de operação variam entre eles
  • JAFAR é uma proposta para padronizar listas de IPs de crawlers, e o processo de padronização ainda está em andamento
  • Mesmo que o registrante do IP apareça como Google LLC, ele pode ser um endereço de hospedagem do Google Cloud, então é necessária uma verificação separada
    • Não foram confirmados casos recentes de falsificação via Google Cloud
  • Se a verificação indicar que o Googlebot real está fazendo crawling excessivo, deve-se seguir a documentação do Google para lidar com crawling excessivo

Autenticação confiável de bots

  • Simplesmente adicionar um campo não dá a agentes maliciosos nenhum motivo para definir esse valor honestamente
  • O chamado evil bit da RFC 3514 satiriza o fato de que agentes maliciosos não seguem esse tipo de padrão
  • Web Bot Auth HTTP Signatures é mais complexo do que um campo separado, mas é uma abordagem para implementar um User-Agent confiável por meio de assinaturas criptográficas

O limite da expressão “maioria”

  • Não há dados que comprovem que as falsificações sejam de fato a maioria de todo o tráfego do Googlebot
  • Ainda assim, a maioria dos casos de tráfego de Googlebot que prejudicou seriamente sites parece vir de Googlebots falsos
  • Pela experiência, o Googlebot real se comporta de forma muito estável, enquanto bots impostores podem continuar enviando solicitações até causar indisponibilidade no site

1 comentários

 
GN⁺ 2 시간 전
Opiniões no Lobste.rs
  • Para usuários de bot, TLS mútuo (mTLS) parece se encaixar bem. Não é difícil para operadores de bots emitir certificados válidos, e operadores de sites podem permitir clientes de bot com base no domínio
    • Como o texto explica, a maioria dos crawlers legítimos publica suas sub-redes de crawler. Também houve tentativas de padronizar a assinatura de requisições, mas, até onde eu sei, isso não chegou a ser amplamente adotado
  • Basta bloquear todo o tráfego que afirma ser googlebot para resolver