6 pontos por mssmss 1 일 전 | 1 comentários | Compartilhar no WhatsApp

Há pouco tempo, um tema esquentou bastante o Hacker News.
Era um post de blog dizendo que detectar AI Slop Text com ML clássico é mais eficaz do que parece.

https://news.ycombinator.com/item?id=48936880
https://blog.lyc8503.net/en/post/llm-classifier/

Embora seja uma abordagem já bastante discutida, o fato de ainda ser válida e eficiente também me pareceu atraente, então criei uma versão para coreano.

  • Ele divide o texto por frases, pontua com um ensemble de TF-IDF de n-gramas de caracteres/palavras + SVM linear e decide o documento inteiro pela proporção de frases suspeitas.
  • A inferência é toda em JavaScript, então roda como uma página estática, sem servidor, API ou GPU. O modelo tem cerca de 1,4 MB, e o texto colado não é enviado para lugar nenhum.

É claro que as limitações também são claras. Como usa ML clássico, como SVM, ele tende a detectar com segurança alguns textos claramente com cara de IA, mas também pode produzir resultados ambíguos em textos mais indefinidos ou acadêmicos.

Mesmo que o resultado diga que é IA, isso não significa necessariamente que seja; mas acho que pode ser útil para verificar textos que possam ter sido criados por IA.

1 comentários

 
selene 1 일 전

Comparei com um texto que eu escrevi, e o que foi escrito diretamente por mim deu 0%; o que foi escrito por IA e depois parcialmente editado deu 51%; e o que foi escrito só por IA deu 100%. Detecta melhor do que eu esperava hehe

É só uma ideia, mas acho que seria mais prático se houvesse uma extensão do Chrome que identificasse o conteúdo com critérios como os do https://github.com/mozilla/readability e mostrasse o resultado da detecção como um semáforo.
(Acho que também seria bom se identificasse automaticamente só os domínios de páginas cadastrados e, no resto, funcionasse manualmente como um recurso de tradução.)