- The Numbers, que fornecia dados de cerca de 78 mil filmes, saiu do ar repentinamente em 5 de março de 2026 e, devido a tráfego automatizado em larga escala e sondagens de segurança voltadas a um sistema de 30 anos, descartou o site antigo e restaurou apenas as funções mínimas
- A participação de humanos no tráfego total era de apenas cerca de 10% e, a partir de dezembro de 2025, a coleta baseada em prompts e o tráfego de IA agêntica dispararam, fazendo com que cerca de 90% do tempo de trabalho da equipe fosse gasto na manutenção do site antigo
- Os logs mostraram não apenas coleta normal, mas também sondagens de backdoors que pareciam buscar acesso antecipado a dados ou manipulação, embora a causa real da indisponibilidade e os responsáveis pelo ataque não tenham sido confirmados
- Como os dados do The Numbers passaram a ser usados como critério de decisão nos mercados de previsão de bilheteria de filmes da Polymarket, dados antes da publicação poderiam oferecer vantagem em negociações, enquanto ferramentas de IA tornam barato sondar vulnerabilidades de sites antigos
- Crawlers de IA não devolvem leitores, mas geram custos enormes e interrupções, rompendo a relação de troca da web aberta; arquivos independentes, notícias, fóruns e sites de referência que dependem de código antigo e equipes pequenas são especialmente vulneráveis
A semana em que a base de dados da indústria cinematográfica desapareceu
- The Numbers é um site de dados sobre cinema que pesquisa e fornece diretamente dados de bilheteria, orçamento de produção, home video e streaming, com mais de 8 milhões de visitantes por ano
- Jornalistas, academia, produtores de cinema, mercados de previsão e o Guinness World Records o usam como fonte confiável
- No início de 2026, o banco de dados continha 78.396 filmes, 178.375 registros de lançamentos em cinemas e 236.176 pessoas
- O site saiu do ar em 5 de março de 2026 e não voltou por mais de uma semana, sendo restaurado em 13 de março em uma versão reduzida sobre nova infraestrutura
- Gráficos históricos, páginas de filmes e o Report Builder desapareceram, restando apenas funções mínimas centradas nos números mais recentes de bilheteria
- Como apenas uma mensagem de reconstrução era exibida, sem explicações específicas, usuários ficaram irritados e surgiram até suspeitas de que a redução de recursos fosse intencional para levar à migração para produtos pagos
Um sistema de 30 anos iniciado em 1997
- Bruce Nash, matemático e ex-desenvolvedor de software da IBM, lançou em 17 de outubro de 1997 um site no Geocities que acompanhava 300 filmes
- O ponto de partida foi gerar HTML a partir de um banco de dados Access, publicá-lo no Geocities e divulgar, no fórum da Hollywood Stock Exchange, análises de bilheteria para uso na negociação de ações de filmes
- O texto retrospectivo dos 20 anos hoje existe apenas como cópia arquivada no Internet Archive
- O site antigo, expandido ao longo de décadas, servia cerca de 2 milhões de páginas a partir de aproximadamente 160 mil arquivos-fonte
Duas ondas de tráfego causadas por crawlers de IA
- Nos primeiros 25 anos, os principais visitantes eram pessoas, mecanismos de busca relativamente obedientes às regras e coletores para projetos pessoais; coletores excessivos podiam ser encontrados e bloqueados
- A primeira mudança começou por volta de 2024, quando crawlers para treinamento de IA se juntaram à coleta dos mecanismos de busca
- Crawlers de IA tendem a seguir menos as regras do que mecanismos de busca, aumentando o trabalho de administração necessário para manter o site estável
- Em 2024, o tráfego automatizado superou o tráfego humano na web como um todo e, depois, nos dados da Cloudflare, bots chegaram a 57,5% das solicitações de páginas web
- A segunda onda começou por volta de dezembro de 2025, com agentes de IA que coletavam sites em resposta a prompts e agentes criados diretamente por usuários aumentando ainda mais o tráfego
- Entre as visitas ao The Numbers, a proporção de navegação direta por humanos era de cerca de 10%; o restante era composto por bots de IA e tráfego automatizado
- De dezembro ao início de março, a equipe gastou cerca de 90% do tempo de trabalho mantendo o site antigo e desenvolvia o novo sistema no tempo restante
A resposta que indicou aos crawlers o caminho de licenciamento
- A equipe colocou no site orientações legíveis por LLMs para levá-los a responder com como comprar uma licença, em vez de coletar os dados diretamente
- Depois disso, as consultas sobre licenciamento de dados aumentaram cerca de 10 vezes
- As medidas de mitigação de tráfego tiveram efeito, mas não resolveram o peso estrutural de ter de continuar operando o serviço enquanto defendia código de 30 anos e 160 mil arquivos
Queda do servidor e vestígios de sondagem de segurança
- O servidor caiu na madrugada de 5 de março, e a equipe inicialmente suspeitou apenas da carga de tráfego de IA
- Nos logs, junto com acessos usando URLs normais, foram encontradas tentativas de encontrar backdoors
- É possível que alguém estivesse tentando acessar dados antes de sua publicação no site ou manipular os dados oferecidos aos usuários
- Houve coleta e sondagens automatizadas por meses, mas não se confirmou o que causou a falha final nem quem a executou
- Seguindo o conselho de especialistas em cibersegurança, o servidor antigo não foi religado
- Restaurar os backups exporia novamente 160 mil arquivos legados a atacantes que já vinham sondando vulnerabilidades havia muito tempo
- Como se julgou que o servidor antigo poderia voltar a cair em poucos minutos após ser reiniciado, foi criada uma versão de funcionalidade mínima em uma nova infraestrutura
O valor financeiro que os mercados de previsão deram aos dados de cinema
- A Polymarket opera mercados sobre o desempenho de estreia de filmes no fim de semana e definiu o
Daily Box Office Performancedo The Numbers como critério de decisão do mercado - Mercados individuais de fim de semana costumam movimentar dezenas a centenas de milhares de dólares, e o conjunto de mercados de bilheteria de filmes abertos simultaneamente pode envolver milhões de dólares
- Se alguém pudesse ver os dados do The Numbers antes da publicação, poderia saber os resultados antes dos demais traders e negociar antecipadamente toda semana
- Mercados de previsão podem transformar quase qualquer dado em valor financeiro; ferramentas de IA baratas reduzem a barreira técnica para invadir sites, e bots agênticos em larga escala ampliam a vulnerabilidade da infraestrutura web existente
Como a IA reduziu a barreira de entrada para ataques cibernéticos
- Em novembro de 2025, a Anthropic divulgou a primeira campanha documentada de espionagem cibernética orquestrada por IA
- Uma organização apoiada por um Estado atacou cerca de 30 instituições, e a IA executou 80% a 90% do trabalho
- Humanos intervieram apenas em 4 a 6 pontos de decisão por campanha
- A barreira para ataques cibernéticos sofisticados caiu muito e parece que continuará caindo
- Segundo um relatório de ameaças anterior da Anthropic, até criminosos com pouca capacidade técnica usam IA para realizar tarefas complexas, como desenvolver ransomware, que antes exigiam anos de treinamento
- A ferramenta autônoma de teste de invasão com IA XBOW chegou ao 1º lugar no ranking dos EUA da HackerOne ao submeter cerca de 1.060 vulnerabilidades
- Um site de 30 anos, com alta probabilidade de conter vulnerabilidades conhecidas, é uma superfície de ataque adequada para ferramentas de IA sondarem a baixo custo; a barreira de especialização que antes protegia sites pequenos enfraqueceu muito
A reconstrução completa do The Numbers
- Embora o site público tenha ficado fora do ar, a principal fonte de receita do The Numbers não foi afetada, então o negócio em si pôde se manter
- Nos últimos anos, o site gratuito não dependia muito de publicidade
- As principais atividades são a OpusData, que vende dados em massa, relatórios de análise comparativa para produtores e investidores de cinema, e o Business Report
- Como é preciso reconstruir do zero um site que oferece 78.396 filmes, 178.375 registros de lançamentos e 236.176 pessoas, não está sendo possível restaurar todas as funções de uma vez
- A equipe divide os usuários que um site público em 2026 precisa atender em seis categorias
- Pessoas
- Mecanismos de busca
- Trabalhos de treinamento de LLMs
- Tráfego de IA baseado em prompts
- IA agêntica
- Traders de mercados de previsão
- Antes, o foco estava em três elementos: conteúdo, publicidade e SEO; agora, cada decisão de design precisa considerar cerca de 8 a 10 elementos
- O novo site tem como objetivo dar suporte a todos os seis tipos de usuários, adicionar os serviços da OpusData e recursos para assinantes do Business Report, e devolver aos usuários comuns os dados antigos em uma forma melhorada
Custo de crawling e visitantes que não voltam
- Nas métricas por plataforma da Cloudflare, o volume de crawling que um site permite para obter um visitante de referência variava muito
- O Google coleta cerca de 5 páginas por visitante
- A OpenAI coleta mais de 1.000 páginas
- A Anthropic coleta mais de 38.000 páginas
- A relação de troca da web aberta, em que mecanismos de busca liam o conteúdo em troca de enviar leitores, não funciona com crawlers de IA
- A coleta em massa aumenta os custos de largura de banda de sites pequenos e pode derrubar o serviço inteiro
Danos causados por coleta em massa em outros sites
- No Read the Docs, um crawler baixou 73 TB de HTML comprimido em um mês, gerando mais de US$ 5.000 em custos de largura de banda
- O iFixit registrou 1 milhão de solicitações em um dia vindas do crawler da Anthropic
- A Triplegangers, vendedora de scans 3D com 7 funcionários, saiu do ar durante o horário comercial por causa do bot da OpenAI, e seu CEO avaliou o episódio como, na prática, um ataque DDoS
- O operador do SourceHut gasta 20% a 100% do tempo de trabalho semanal lidando com crawlers de IA e sofre dezenas de breves interrupções por semana
- O site de notícias sobre Linux LWN considerou o tráfego de crawlers vindo de milhões de IPs um ataque distribuído de negação de serviço
- Cerca de 97% do tráfego medido pelo projeto open source GNOME era de bots
- Uma biblioteca universitária bloqueou 16 mil endereços IP em 48 horas para manter seu serviço de catálogo funcionando
Os custos e a queda de leitores enfrentados pela Wikipedia
- Em abril de 2025, a Wikimedia Foundation calculou que bots respondiam por cerca de 35% das visualizações de páginas da Wikipedia, mas representavam ao menos 65% do tráfego com maior custo de processamento
- Como crawlers capturam em massa até páginas que quase nenhum humano lê, sua participação nos custos é maior
- Seis meses depois, as visualizações de páginas da Wikipedia por humanos caíram cerca de 8% em relação ao ano anterior
- Cresce o número de usuários que obtêm conhecimento por resumos de IA em vez de visitar diretamente a Wikipedia
- Sistemas de IA capturam conteúdo em grande escala e, ao mesmo tempo, reduzem os leitores que o site original receberia
Uma situação em que as premissas da internet existente ruíram
- Ferramentas de IA são poderosas, mas também destrutivas, e estão sendo testadas pelo público em ambientes reais e em tempo real
- A web aberta existente foi construída sobre as seguintes premissas, mas todas elas não correspondem mais à situação atual
- A maioria dos visitantes é humana
- O tráfego é, em geral, proporcional ao número de leitores
- O custo de oferecer um site está ligado ao valor obtido pelo operador
- Independentemente da questão de negar ou não a utilidade da IA, a web atual não estava preparada para a força e a escala de modelos de IA acessíveis a qualquer pessoa
Cobrança por crawling e experimentos de bloqueio padrão
- A Cloudflare lançou o pay-per-crawl, que permite a sites cobrar crawlers de IA por página
- Depois, anunciou um modelo pay-per-use, que paga editores quando o conteúdo é de fato usado em respostas de IA
- A partir de 15 de setembro, páginas baseadas em publicidade de clientes da Cloudflare passarão a bloquear por padrão crawlers
mixed-useque não pagam - O sucesso dessas políticas depende de as empresas de IA participarem do sistema de cobrança, em vez de contorná-lo tecnicamente
Um alerta para todos os sites independentes
- O The Numbers perdeu o site inteiro entre o tráfego excessivo de máquinas e a possibilidade de invasão, mas conseguiu sobreviver porque o site público não era todo o seu negócio
- A empresa têxtil alemã ZEGO, em operação havia 37 anos, pediu falência depois que um ataque cibernético em março interrompeu a produção por seis semanas
- Arquivos independentes, bancos de dados de hobbies, notícias locais, fóruns e sites de referência preservam conhecimento coletivo acumulado enquanto dependem de código antigo e equipes pequenas ou operadores individuais
- O The Numbers está se recuperando com uma estrutura melhor, e continuar usando e apoiando pequenos sites criados para a internet existente está diretamente ligado à sua sobrevivência
1 comentários
Comentários do Hacker News
Falando sério, será que mercados de previsão não poderiam se tornar uma nova fonte de receita para o TheNumbers.com? É possível que alguns atacantes tenham tentado obter números antes da divulgação pública para apostar em mercados de previsão com informação garantida
Isso é claramente insider trading e extremamente antiético, mas o CEO da PolyMarket já afirmou que insider trading faz parte do propósito do serviço: https://youtu.be/ZN4njIQcSR4?si=ztyTtgjeHSJbNjSZ&t=1566
O ponto principal não é apenas que agentes estejam martelando o site, mas que há vulnerabilidades potenciais exploráveis. É por isso também que o site saiu do ar e voltou com dados e design bastante reduzidos
Se um usuário malicioso acessar dados ainda não publicados do The Numbers, toda semana ele pode saber a resposta antes dos outros traders e fazer front-running
Ao ver a especulação no Reddit de que teria sido um rug pull deliberado para quebrar um site gratuito e empurrar usuários para um produto pago, fico pensando se haverá ainda menos recursos gratuitos daqui para frente
Antigamente eu publicava pequenas ferramentas como open source esperando que alguém as usasse para resolver problemas parecidos, mas agora o fato de elas serem raspadas, virarem dados de treinamento e depois serem monetizadas me deixa relutante em contribuir para a web gratuita. Dá para entender por que operadores de sites gratuitos úteis ficam irritados
Não é só ver seu trabalho usado de um jeito desagradável: os custos e o tempo de manutenção aumentam, causando prejuízo real
Alguns anos atrás, durante a Covid-19, eu mantive um site para consultar os auxílios do governo dos EUA a pequenos negócios e empréstimos fraudulentos denunciados pelo DOJ. Todo o conjunto de dados público, cerca de 10 GB, podia ser baixado gratuitamente, e as doações acumuladas foram de cerca de US$ 2 mil
Só que os crawlers de IA, em vez de usar o link de download completo na página inicial, percorreram todas as combinações de filtros de busca e baixaram dezenas de terabytes de HTML. Mesmo com cache no CloudFront e um backend eficiente, só o custo mensal de rede chegou a cerca de US$ 1 mil, então fechei o site no mês seguinte
Mas, se você perder o pagamento, o servidor pode ser apagado em cerca de uma semana, então nunca deixe atrasar
Não precisamos de padrões técnicos e bibliotecas open source para lidar com essa nova composição de tráfego? Milhões de pequenos sites e criadores não têm capacidade de se defender sozinhos contra acessos automatizados em grande escala, e quanto mais útil for o conteúdo, mais crawling agressivo ele recebe, aumentando custos operacionais e instabilidade
Precisamos de ferramentas de gestão comunitária que incluam identificação de agentes, limitação de taxa, classificação de tráfego, políticas de acesso, cache, procedimentos de verificação, logging, confirmação de origem e controle de uso. Em vez de cada operador criar tudo sozinho do zero, deveríamos fornecer regras comuns e robustas adequadas ao tráfego automatizado de hoje
Como há até empresas vendendo publicamente acesso via proxy de smart TVs e celulares infectados, não daria para criar um banco de dados desses IPs e bloqueá-los? Com avisos de bloqueio que orientem as pessoas a verificar dispositivos infectados em casa, talvez seja possível atacar a raiz do problema: https://news.ycombinator.com/item?id=49000864
No fim, voltamos aos meios tradicionais de controle de picos de tráfego. As ferramentas propostas vêm sendo usadas há décadas para conter o efeito Slashdot, DDoS e crawling excessivo por mecanismos de busca, e empresas como a Cloudflare já lideram essa área
Empresas de IA realmente socializam os custos e privatizam os lucros. Sites como The Numbers arcam com os custos de resistir à ofensiva da IA, mas não recebem nada em troca das empresas de IA
Se os crawlers tivessem pago licença pelos dados completos e de qualidade, não haveria problema; o ponto central é que eles começaram até a procurar vulnerabilidades para acessar dados antes da publicação
A área pública gratuita parece ser um site ideal para refazer com um gerador de site estático e combinar com uma CDN com detecção de bots. Assim, parece que daria para operá-lo por muito tempo a um custo razoável
Também fiquei curioso sobre as arquiteturas antiga e nova, e sobre as estratégias de mitigação e escalabilidade adotadas para manter o site
Até sites PHP frágeis dos anos 2000 processavam cerca de 200 requisições por segundo, sites estáticos passavam de 1.000, e o Node.js prometia 100 mil por segundo com threading cooperativo. Já os sites de hoje executam centenas a milhares de consultas ao banco de dados por causa de ORMs e do problema N+1, levando mais de 500 ms para responder e já sentindo peso com 1.000 usuários simultâneos
O cache em boneca russa, independente de linguagem e banco de dados, e a invalidação precisa de cache dos dados dependentes não se popularizaram. Já tentei até eventos touch do Laravel e cache de consultas com Redis, mas invalidação de cache é, na prática, um problema sem solução; em vez de implementar por conta própria, é preciso considerar desde o início estratégias como pacotes e sharding
A web deveria ter se tornado um armazenamento P2P endereçado por conteúdo, como o BitTorrent, recebendo conteúdo de peers próximos, mas HTTPS/SSL e o modelo de segurança dos navegadores foram obstáculos. Talvez seja necessário até uma rede de confiança ou provas de conhecimento zero; por enquanto, parece que ficaremos presos às antiquadas telas de verificação humana
Em 2015, comecei o Applaudience, que na época era o único a fornecer dados em tempo real de venda de ingressos de cinema, e durante o processo de calibração eu costumava comparar com os números do TheNumbers.com
Hoje estou em outro negócio, mas, entre as tecnologias que criei pessoalmente, essa ainda é a minha favorita, então quero retomá-la algum dia
Os crawlers das grandes empresas de IA podem ser bloqueados no
robots.txtdefinindoDisallow: /respectivamente paraClaudeBot,Claude-SearchBot,Claude-User,GPTBot,OAI-SearchBot,PerplexityBot,Google-Extended,Google-Extended-FactualeBingbotcrawl-delaypara ajustar de acordo com as condições do servidor, mas ele não dá: https://developers.google.com/crawling/docs/robots-txt/robots-txt-spec#syntaxAo bloquear, o tráfego vindo de buscas também deve cair ainda mais
Como resultado, uma requisição desnecessária era adicionada à maioria das URLs de subdiretórios
Opero um pequeno site, http://radar.lv, que arquiva antigas transmissões de rádio em russo; antes, o tráfego dos EUA era de 5%, mas recentemente 90% vem dos EUA
Felizmente consigo aguentar até 1 TB por mês, e não sou contra o crawling em si, mas me preocupo com a estabilidade para visitantes reais. Estou pensando se ativo o recurso recente da Cloudflare de pagamento por visita
Meu blog pessoal usa um gerador estático, mas este arquivo também tem o problema de usar um Drupal antigo que deixou de receber patches de segurança há anos