Qualquer pessoa com contato interno na OpenAI é convidada a pedir solução para problema com crawler
(mailman.nanog.org)Problema de rastreamento de sites pelo GPTBot da OpenAI
-
O autor relata que o GPTBot da OpenAI vem acessando seu site,
web.sp.am, e rastreando páginas em excesso- Ele fez cerca de 3 milhões de requisições de páginas por dia, das quais 1,8 milhão eram requisições a
robots.txt - O site do autor tem estrutura de Content Farm, com 6,859 bilhões de sites, cada um com 1 página
- Todas as páginas parecem quase idênticas e usam o mesmo IP e o mesmo certificado SSL curinga, então não deveria ser difícil para o crawler entender a situação
- Ele fez cerca de 3 milhões de requisições de páginas por dia, das quais 1,8 milhão eram requisições a
-
Há 1 ou 2 meses, o crawler da Amazon causou um problema parecido, mas foi possível entrar em contato e fazer o rastreamento parar
-
O autor está perguntando se existe alguém com quem seja possível entrar em contato na OpenAI
-
O autor brinca que parece que os dados do seu site estão sendo usados no treinamento do GPT-5
Opinião do GN⁺
- Quando um crawler não interpreta corretamente o
robots.txte envia requisições excessivas, isso pode causar danos ao serviço da outra parte mesmo que não haja má intenção. A OpenAI também parece precisar corrigir rapidamente a lógica do crawler - Especialmente em locais que operam inúmeros domínios, como uma Content Farm, vale considerar medidas como filtragem baseada em IP para evitar rastrear cada site individualmente
- Parece necessário haver processos e sistemas para monitorar o comportamento de bots de rastreamento, detectar sinais anormais e responder rapidamente
- É preciso manter comunicação próxima com os administradores dos sites rastreados para minimizar danos. Em vez de focar apenas na coleta de dados, a perspectiva de coexistência é importante
1 comentários
Opiniões do Hacker News
Isso me lembra quando GPT-2/3/J encontrou https://reddit.com/r/counting. É um lugar onde usuários do Reddit contam infinitamente, aumentando os números um a um, e nomes de usuário como SolidGoldMagikarp aparentemente pareciam strings tão comuns na internet que, no processo de tokenização, acabaram sendo tratados como tokens independentes
https://www.alignmentforum.org/posts/8viQEp8KBg2QSW4Yc/solid...
https://www.lesswrong.com/posts/LAxAmooK4uDfWmbep/anomalous-...
O vocabulário não é infinito, e sabe-se que o vocabulário do GPT-3 tinha apenas 50.257 tokens. Fico curioso se talvez fosse mensurável a diferença entre o custo extra de energia causado por esse hobby de nicho do Reddit e a redução no número médio de tokens de entrada caso esse espaço tivesse sido atribuído a substrings mais comuns em textos reais
Seria engraçado se o subtítulo do site do OP, IECC ChurnWare 0.3, virasse um token do GPT-5
Na prática, em contextos que não são conversas individuais, uma resposta como “não sei” geralmente não é útil. Em um grupo, o silêncio já indica esse fato quando você não sabe
https://www.youtube.com/watch?v=WO2X3oZEJOA
Fico mais curioso sobre para que serve aquela fazenda de conteúdo. Parece sem sentido, mas deve haver algum incentivo econômico estranho. Há links de afiliados, mas fico pensando quanto isso poderia render
Ele é uma figura conhecida no combate ao spam, com várias atividades há décadas. Inserir naturalmente um link para a landing page em uma mensagem da NANOG também é uma forma de fazer bots morderem a isca
https://compilers.iecc.com/
Na página https://www.iecc.com/linker/, antes ele disponibilizava rascunhos do livro em vários formatos, mas quando isso apareceu em https://news.ycombinator.com/item?id=18424233, eu empacotei os arquivos para leitura offline e, depois disso, o texto mudou para “não oferecemos mais por causa da pirataria crônica”
Perguntei por e-mail se estava tudo bem, mas recebi uma resposta pouco amigável dizendo que eu tinha pirateado os arquivos, então removi o link, e eles mudaram o texto. Eu não sou o autor do livro; eles são, então é direito deles. Ainda assim, sugeri que colocassem na página um aviso dizendo para não fazer isso, mas eles escolheram uma abordagem mais radical
Só eu esperava que fosse sobre aranhas de verdade infestando a server farm da OpenAI e entrando nos racks de outras pessoas? Eu sabia que não seria isso, mas estava torcendo
O robots.txt não estava configurado corretamente. A parte que realmente bloqueava estava comentada
Tanto o
Disallow: /para Amazonbot quanto para GPTBot estavam comentados, e o que se aplica atualmente é apenas o bloqueio de/archiveparaUser-agent: *Se seguirem o robots.txt, a OpenAI tem ao mesmo tempo um problema de bloqueio de bots e de coleta de dados: https://x.com/AznWeng/status/1777688628308681000
Entre os 100 mil sites mais acessados, 11% já bloqueiam o crawler da OpenAI, mais do que todos os concorrentes Google, FB, Anthropic e Perplexity somados
Considerando que robots.txt não é vinculante e que, em outros contextos, eles parecem bem pouco constrangidos em sugar dados públicos, é surpreendente que deixem isso se tornar um obstáculo à experiência do usuário
Acho que bastaria deixar rolar. Se é internet que ele quer, isso é a internet de verdade. Como ele não parece se importar muito com o fato de alguém levar milhões de páginas, é só deixar acontecer
No mundo da segurança de redes, isso é chamado de tarpit. Dá para atrasar ataques, varreduras e outras automações enviando dados muito lentamente ou provocando recursão infinita
No fim, isso desperdiça o tempo e a energia do atacante e pode nos dar tempo para reforçar nossas defesas
Um tarpit é diferente, porque é projetado para desacelerar varreduras ou scraping e desperdiçar deliberadamente os recursos do outro lado. Há várias técnicas, mas a maioria limita exponencialmente as respostas ou a velocidade de resposta
Em 2011, aconteceu algo parecido quando o projeto picolisp publicou uma espécie de “ticker” de cadeia de Markov que gerava páginas na hora
https://picolisp.com/wiki/?ticker
É uma forma bem interessante de honeypot
No fim, empresas como a OpenAI acabarão treinando seus modelos quase só com conteúdo gerado por IA e, do ponto de vista de Q&A, esse conteúdo com bastante frequência é um pouco incorreto, então a qualidade das respostas de IAs treinadas com ele também vai piorar rapidamente
Hoje a maior parte do conteúdo da internet é escrita por humanos, mas daqui a 5 anos talvez não seja mais. Vejo isso como um dos grandes problemas que a área de IA precisa resolver logo. Como diz o velho ditado: entra lixo, sai lixo
A ironia de toda essa situação é cruel
Parece mais um problema de bootstrapping do que um ouroboros
A era dos transformers que lidam apenas com texto, na minha opinião, já passou
Acho que a OpenAI lê o robots.txt, mas indexa mesmo assim. Só deve deixar uma marca indicando que era conteúdo que não deveria ser indexado