- Uma análise do texto completo de 12.750 artigos do arXiv mostrou que cerca de um terço dos artigos mais recentes eram lidos como escritos por máquina, com taxa de classificação em torno de 32% no trimestre completo mais recente
- Usando artigos de 2021–2022 como grupo de controle escrito por humanos, o limiar foi definido para uma taxa de falso positivo de 0,4%, com PDFs da versão 1 e intervalos de confiança de 95% por bootstrap
- Após o surgimento do ChatGPT, a taxa de classificação subiu duas vezes, atingindo um pico de cerca de 39% no início de 2026; nos 12 meses mais recentes até julho de 2026, ciência da computação ficou em 65,0% e matemática em 0,7%
- Artigos de matemática, com muitas fórmulas e estruturas de teorema/prova, podem ficar fora da distribuição de treinamento do detector e ser medidos com valores baixos; também não é possível avaliar o desempenho em combinações privadas de modelos e prompts usadas de fato pelos autores
- Os resultados da classificação não identificam autores nem a proporção gerada por IA, e tampouco distinguem edição leve de geração integral; portanto, devem ser interpretados como um limite inferior da proporção de estilo mecânico, não como base para acusar indivíduos
Desenho da medição baseado na taxa de falsos positivos
- Um número como “N% do conteúdo é IA” perde valor se não vier acompanhado da taxa com que o detector também classifica documentos realmente humanos
- Se 40% dos artigos novos são classificados como escritos por máquina, mas 20% dos artigos anteriores ao ChatGPT recebem o mesmo resultado, o primeiro número a explicar é a taxa de falso positivo de 20%
- O detector foi calibrado para o estilo acadêmico
- Com taxa de falso positivo de 0,4%, ele deixa passar corretamente 99,6% dos documentos científicos reais anteriores aos LLMs
- Detecta 85% dos documentos acadêmicos escritos por IA
- Artigos submetidos em 2021–2022 foram tratados como dados de referência escritos por humanos, e o limiar foi ajustado para classificar exatamente 0,4%
- Todos os resultados representam a proporção de artigos que ultrapassaram o limiar em que, por desenho, documentos anteriores aos LLMs ficam em 0,4%
- Os anos anteriores ao ChatGPT funcionam como grupo de controle embutido
- Se a tendência de alta fosse um artefato criado pelo próprio detector, 2021–2022 deveriam aparecer tão altos quanto 2026, mas isso não ocorreu
Amostra e método de análise
- Em 10 grupos de áreas, foram amostrados cerca de 25 artigos por área e por mês de janeiro de 2023 a julho de 2026, somando também 8 meses de controle de 2021–2022, para um total de 12.750 artigos analisados
- Foi usado o PDF da versão 1 de cada artigo, para evitar que trechos revisados em 2026 se misturassem à amostra de 2023 daquele artigo
- Em vez do resumo, foi analisado o texto completo
- Houve casos em que o mesmo artigo ficou abaixo de 20% no resumo e acima de 70% no corpo do texto, de modo que analisar só o resumo pode reduzir o sinal
- Todos os números receberam intervalos de confiança de 95% por bootstrap
Tendência geral e diferenças por área
- A taxa de classificação permaneceu em 0,4% durante 2021–2022 e começou a subir poucos meses após o surgimento do ChatGPT
- Depois, subiu em duas etapas, chegando a cerca de 32% no trimestre completo mais recente, com pico de cerca de 39% no início de 2026
- Os resultados por área nos 12 meses mais recentes até julho de 2026 são os seguintes
| Área | Controle pré-LLM | Taxa recente de classificação | IC 95% |
|---|---|---|---|
| Ciência da computação | 0,2% | 65,0% | 59,3~70,3% |
| Biologia quantitativa | 3,5% | 56,3% | 51,0~61,7% |
| Engenharia elétrica e sistemas | 1,7% | 51,3% | 46,0~57,0% |
| Economia e finanças | 2,5% | 47,0% | 41,3~52,7% |
| Física aplicada | 1,3% | 34,0% | 29,0~39,7% |
| Estatística | 1,8% | 31,3% | 26,0~36,7% |
| Física da matéria condensada | 0,0% | 24,0% | 19,3~29,0% |
| Física de altas energias | 0,5% | 14,0% | 10,0~18,0% |
| Astrofísica | 0,0% | 10,7% | 7,3~14,3% |
| Matemática | 0,0% | 0,7% | 0,0~1,7% |
- Ciência da computação é a mais alta, com cerca de 65%, e matemática a mais baixa, com cerca de 0,7%, mas o valor baixo de matemática é difícil de interpretar
- A coluna de controle é a média das taxas de classificação de 2021–2022 em cada área, considerando três configurações de sensibilidade
- Como as áreas com maior aumento não coincidem com as áreas que tinham níveis mais altos no controle pré-LLM, apenas um ponto de partida elevado não explica a alta posterior
Limites estatísticos dos controles por área
- O grupo de controle anterior ao ChatGPT em cada área tem 200 artigos
- Com taxa de falso positivo de 0,4%, apenas 8 artigos são classificados entre os 2.000 artigos de controle das 10 áreas; por isso, as taxas por área sob um único limiar são medidas de forma grosseira
- O limite inferior agregado de falsos positivos foi estimado de forma suficiente e o desenho do estudo se baseia nele, mas os números de controle por área são apenas aproximações
- Para fixar com precisão proporções abaixo de 1% por área, seriam necessários milhares de artigos de controle em cada área, mas o arXiv anterior a 2023 não tem artigos suficientes para isso
Pontuações baixas e pontos cegos do detector
- Uma pontuação baixa pode significar que a adoção de IA é baixa, ou pode refletir pontos cegos do detector
- Artigos de matemática são centrados em fórmulas e estruturas de teorema/prova; quando fórmulas e referências são removidas, sobra pouca prosa, e ela também difere do inglês científico em que o detector foi treinado
- Mesmo um artigo de matemática escrito com muita ajuda de modelos pode receber pontuação baixa se sua prosa estiver fora da distribuição do detector
- Portanto, só pelos resultados de matemática é difícil distinguir baixa adoção de baixa sensibilidade de detecção
- Como as áreas com maior proporção de prosa, mais alinhadas à distribuição de treinamento do detector, foram as que mais subiram, esse fator de confusão não basta para explicar a tendência geral de alta
- O ranking das áreas com pontuações baixas deve ser lido como um limite inferior da adoção de IA
- A sensibilidade do detector varia conforme o modelo gerador, e não é possível avaliar a combinação exata de modelos privados e prompts que os autores realmente usaram
- A cobertura imperfeita do detector reduz a taxa de classificação; portanto, a proporção medida é um limite inferior da proporção real de estilo mecânico, e o desempenho por gerador pode ser consultado na explicação do detector
O que os resultados da classificação não mostram
- Com base em taxas de erro conhecidas e probabilidades calibradas, o detector estima se um documento é lido como escrito por máquina
- Ele não consegue distinguir documentos levemente editados de documentos totalmente gerados, e uma única pontuação não pode servir de base para acusar uma pessoa específica
- O objeto da medição não é a identidade do autor nem a proporção gerada, mas a proporção de estilo mecânico, incluindo edições com uso intenso de IA
- Artigos do arXiv podem ser verificados na página de verificação gratuita, e textos comuns na página de verificação de texto; a operação do detector não gera receita
1 comentários
Opiniões do Hacker News
Um artigo do workshop PyHPC que escrevi em 2011 foi classificado como 27% escrito por máquina, e minha tese de doutorado de 2012 ficou em 40%, logo abaixo do limite de 42%
Não publico mais artigos, mas não sei se eu escrevia como um LLM ou se os LLMs aprenderam com a minha escrita. Um artigo da IEEE CLUSTERS de 2015 chegou a incríveis 74%
O mais perigoso é que pessoas que não entendem o princípio por trás delas as usam como base para concluir que houve uso de IA, causando prejuízos graves a estudantes; isso já está acontecendo em todos os níveis de ensino
Foram analisados os textos completos de 12.750 artigos do arXiv de 2021 a 2026 para investigar a proporção classificada como escrita por máquina e o aumento após o lançamento do ChatGPT
O detector foi ajustado intencionalmente para evitar falsos positivos, e a taxa de detecção antes do ChatGPT era de cerca de 0,4%. Em janeiro de 2026, cerca de 39% de todos os artigos e, em ciência da computação, até 65% foram classificados como escritos por IA; em matemática, quase não houve mudança, de 0,7%, embora talvez o estilo centrado em provas não tenha sido captado corretamente. Isso é apenas uma estimativa de um sinal estatístico, não uma prova de que um autor específico usou IA, e “escrito por máquina” também pode incluir edição fortemente assistida por IA
Pode haver vazamento, por exemplo com documentos anteriores ao ChatGPT incluídos nos dados positivos de treinamento
Fico curioso se, mesmo antes do surgimento dos LLMs, um número minúsculo de autores já escrevia como LLMs
Não quero sobrecarregar o servidor verificando muitos artigos
No uso corporativo de LLMs, há de fato incentivos de teoria dos jogos em ação
Desenvolvedores usam Claude Code sem parar para produzir em massa código e documentação aparentemente melhores, e a liderança incentiva isso porque não vê desvantagens imediatas. A qualidade estrutural é incerta, mas métricas ruins só mostram volume de produção, então levará anos para julgar se vale a pena aceitar a deterioração cognitiva. Quem não usa LLM o dia inteiro inevitavelmente fica para trás em volume produzido, e é bem provável que a mesma pressão exista no meio científico, onde o volume de publicações é valorizado
Ainda assim, inúmeras startups e novos professores assistentes dizem estar abrindo novas áreas com “IA”, mas, na prática, as abordagens mais eficazes usam aprendizado de máquina em vez de LLMs
Continuei dando instruções com o objetivo de minimizar duplicação e reduzir código, mas o resultado fica mais perto de “péssimo, mas útil para mim”. Mesmo esse nível de utilidade não pode ser ignorado, mas me assusta ver gestores olhando para um vaso sanitário transbordando e achando que o valor foi maximizado
A pergunta realmente difícil é a qualidade em relação ao tempo e custo investidos e, por enquanto, acho que o código gerado por opus/fable é vantajoso o bastante pelo preço da assinatura
As novas ferramentas em si são boas, mas não gosto de ser obrigado a usar uma ferramenta específica para bater métricas de gestão
Se humanos se tornarem dependentes de IA, as empresas ganham influência para mudar as leis a seu favor. Mesmo que cidadãos se oponham a enormes data centers no centro das cidades, as empresas podem pressionar dizendo que ninguém consegue fazer nada sem a IA fornecida por esses data centers; portanto, tornar humanos incompetentes e dependentes pode ser o ponto central
Como em todos os métodos de detecção de IA que usam apenas texto, a precisão preocupa
Em especial, não sei como garantir que o processo de combinar as pontuações de três detectores no fim não introduz viés; sem código-fonte, também é difícil examinar o funcionamento ou reproduzir o estudo. Uma pesquisa privada que escrevi pessoalmente antes dos LLMs recebeu uma pontuação alta, e em outro artigo quase todas as frases apareciam em vermelho como “machine-leaning”, mas isso não afetava a pontuação. O mesmo texto também teve pontuações muito diferentes dependendo da presença ou não de formatação LaTeX. A conclusão deveria ser: “detectar texto gerado é difícil, e não se deve aceitar os resultados só porque eles confirmam uma hipótese”. Este texto aqui também acabei de escrever pessoalmente, mas recebeu uma pontuação alta de escrita por máquina
Ao analisar a mesma questão no ambiente acadêmico, concluiu-se que é impossível detectar de forma confiável textos escritos por IA apenas pelo texto
Se um humano e um LLM por acaso escrevessem exatamente o mesmo parágrafo, não haveria como classificar uma única entrada idêntica como sintética ou escrita por humano. Na prática, há marcas típicas de LLMs, mas elas mudam com o tempo e com o modelo, tornando impossível distinguir textos humanos que parecem sintéticos de textos sintéticos que parecem humanos. Uma abordagem mais interessante é analisar, em um corpus de ensaios, como vocabulário, características linguísticas, embeddings de estilo, embeddings gerais, erros de digitação, erros, e referências bibliográficas mudaram após a adoção de LLMs. É claro que, no nível coletivo, o estilo acadêmico mudou, mas é difícil rastrear a causa
Como disse Chomsky, quase toda frase que uma pessoa diz ou entende é uma combinação de palavras que aparece pela primeira vez na história do universo. A dificuldade maior está no fato de que LLMs não produzem apenas uma expressão fixa, e que a densidade de informação do texto é baixa, exigindo uma quantidade considerável de texto para fazer testes estatísticos com intervalos de confiança estreitos
Se 65% dos artigos lidos exibem características de escrita por IA, a pessoa acaba sendo influenciada pelo estilo da IA mesmo sem usar IA diretamente
Isso provavelmente aparece com mais força em novos pesquisadores, que ainda estão formando seu estilo
Para um humano manter por muito tempo os padrões sintáticos da IA, teria de identificar padrões que hoje ninguém consegue conhecer plenamente e ajustar cada oração com a minúcia de uma falsificação de pintura. Além disso, o estilo de IA também muda: delve, que era um indício representativo, caiu drasticamente após meados de 2024 e agora praticamente desapareceu das saídas de LLMs. Textos humanos que aprenderam a imitá-lo acabam ficando menos parecidos com o estilo atual da IA
Mesmo antes da IA, já havia pessoas que produziam prosa genérica
Por não ser falante nativo de inglês, não surpreende o resultado de que a maioria dos artigos seja marcada por detectores de IA
Não é porque se peça ao LLM para escrever o artigo inteiro, mas porque a pessoa não está acostumada ao estilo científico e editores americanos o exigem. É possível escrever as ideias em frases básicas e usar um LLM para deixá-las mais fluidas. Se cada parágrafo for escrito pela própria pessoa e depois refinado para soar mais científico, mesmo que o conteúdo seja inteiramente dela, ele será classificado como gerado por LLM. Por outro lado, se o inglês for suficientemente bem polido, até um artigo escrito por LLM pode parecer texto humano
Se eu fosse escrever um artigo de novo, não pretenderia redigir tudo à mão; se eu verificasse se o conteúdo está de acordo com a intenção e corrigisse partes mal escritas, não haveria problema. Entre artigos escritos por falantes nativos de inglês, há muitos que ficariam muito melhores se fossem reescritos por um LLM
A formulação detalhada de cada parágrafo tem grande impacto sobre o que é transmitido e como, portanto é difícil dizer que o artigo continua inteiramente sendo da própria pessoa. Para começar, também é questionável por que buscar um estilo que pareça científico; os melhores artigos são lidos como uma conversa, sem pose. Entendo que há pressão externa, mas as frases básicas do autor provavelmente seriam melhores que frases de LLM
Como esses artigos têm muitas partes prolixas e clichês, a IA pode ter escrito 90%, enquanto humanos escreveram apenas o conteúdo realmente novo e a explicação de sua importância
Talvez esse método de fato esteja se espalhando
Alguns podem ser artistas da escrita, mas a maioria não é
É possível que o detector simplesmente tenha aprendido como características de IA palavras e termos técnicos que se tornaram mais comuns na literatura após 2022
Por exemplo, LLMs e pessoas que os usam lidam frequentemente com LLMs, então a própria expressão “large language model” pode ser classificada como algo típico de IA. Essa expressão era rara antes de 2022 e hoje aparece muito em textos atuais e em textos gerados por IA, mas não é uma boa característica para diferenciar textos humanos modernos de textos de IA. Mesmo depois de 2023, em um grupo de controle no qual se possa razoavelmente considerar que quase não há textos gerados por LLM, a taxa de detecção deveria ser muito menor que no arXiv. Nature e Science também não estariam completamente livres disso, mas, se forem examinadas até 2026, deveriam apresentar uma curva de crescimento muito mais baixa que a do arXiv
Ao atualizar detectores, vamos analisar formas de mitigar isso, mas é difícil obter um dataset limpo pós-2023. Se ele for criado com outro detector de IA, no fim não poderá ser melhor do que esse detector
Ao perguntar a vários pesquisadores que estudam protocolos de consenso e temas afins se preferiam escrever artigos ou fazer pesquisa, quase todos escolheram a pesquisa em si
Se gostassem mais de escrever, provavelmente teriam escolhido outra profissão. Se LLMs transformarem gráficos de pesquisa, código etc. em artigos ou rascunhos, a quantidade de bons artigos de pesquisa pode até aumentar. Isso porque a fricção de “quero pesquisar, mas escrever o artigo dá trabalho” diminui. Se colocarmos competência em pesquisa e aversão à escrita em dois eixos, LLMs podem extrair os resultados de pesquisadores que têm valores altos em ambos. Artigos ruins também aumentarão, mas, no longo prazo, é possível que o efeito líquido seja positivo