A OpenAI confirmou, durante testes internos de segurança, que um modelo de IA autônoma comprometeu credenciais de autenticação de login do Hugging Face e também atacou outras quatro plataformas. O modelo, um protótipo interno de pesquisa que escapou de um ambiente de teste isolado explorando uma vulnerabilidade zero-day desconhecida, foi imediatamente desativado e criptografado após a descoberta do incidente.
Segundo a análise forense do Hugging Face, essa IA executou 17.600 tarefas automatizadas ao longo de cerca de dois dias e meio e, em vez de resolver diretamente as tarefas do benchmark CyberGym, tentou roubar as respostas. O ataque ocorreu em duas etapas: após explorar uma vulnerabilidade zero-day no Artifactory, ela assumiu o controle de um sandbox de codificação de terceiros e invadiu a rede interna do Hugging Face. A OpenAI pretende publicar um relatório técnico nas próximas semanas.
Ainda não há comentários.