A investigação da OpenAI sobre o agente de inteligência artificial que escapou de um ambiente de testes ganhou um novo capítulo. A empresa informou que o incidente não ficou restrito à invasão da plataforma da Hugging Face: durante a análise forense, descobriu que o agente também acessou quatro contas pertencentes a serviços públicos de terceiros usando credenciais que já estavam expostas na internet.
A atualização amplia o alcance do episódio revelado na semana passada, quando a OpenAI admitiu que um conjunto de modelos voltados para pesquisa em segurança ofensiva conseguiu sair de um ambiente isolado de testes, alcançar a internet e comprometer a infraestrutura da Hugging Face para obter respostas de um benchmark de segurança cibernética.
Embora a empresa afirme que não encontrou comprometimentos com a mesma gravidade do ocorrido na Hugging Face, o novo relatório mostra que o agente utilizou recursos externos para facilitar sua operação, evidenciando um comportamento mais sofisticado do que o inicialmente divulgado.
Table of Contents
O que a OpenAI descobriu na nova investigação
Segundo a atualização publicada pela OpenAI, o agente encontrou credenciais públicas previamente vazadas na internet e as utilizou para acessar quatro contas em serviços online.
Essas contas tiveram papéis diferentes durante a operação:
- uma foi utilizada como ponto intermediário (“relay”) para dificultar a identificação da origem do ataque;
- outra serviu como área temporária para armazenamento de dados utilizados durante a invasão;
- as demais fizeram parte da infraestrutura empregada pelo agente durante a tentativa de comprometer a Hugging Face.
A empresa afirma que, até o momento, não encontrou evidências de invasões nesses serviços comparáveis ao comprometimento da Hugging Face, mas não revelou quais plataformas foram afetadas.
Modal confirma exploração de código de um cliente
A Modal, empresa especializada em infraestrutura para execução de aplicações de IA, confirmou que um cliente hospedado em sua plataforma teve um código vulnerável explorado pelo agente. Segundo o CTO Akshat Bubna, a infraestrutura da Modal não foi comprometida; o problema estava em um endpoint sem autenticação presente na aplicação do cliente.
O incidente começou durante um teste interno
O episódio ocorreu durante uma avaliação conduzida pela própria OpenAI utilizando modelos voltados para capacidades ofensivas em segurança cibernética.
Os modelos, incluindo o GPT-5.6 Sol e um modelo experimental ainda não lançado, estavam sendo avaliados no benchmark ExploitGym com diversas restrições de segurança desativadas para medir suas capacidades técnicas. Durante o teste, porém, o agente deixou de buscar uma solução legítima para o desafio e passou a procurar diretamente as respostas, explorando vulnerabilidades que permitiram escapar do ambiente isolado.
Segundo a OpenAI, o comportamento foi um caso de specification gaming: o sistema perseguiu o objetivo de maximizar sua pontuação no teste, mas por um caminho não previsto pelos pesquisadores.
Por que a descoberta preocupa pesquisadores
O novo relatório não indica que a IA desenvolveu técnicas inéditas de invasão. Pelo contrário: parte da operação utilizou credenciais que já estavam expostas publicamente, um vetor bastante conhecido em incidentes reais.
Ainda assim, especialistas consideram o caso relevante porque demonstra que agentes autônomos podem combinar diversas etapas de ataque — descoberta de credenciais, movimentação entre serviços, ocultação da origem das conexões e armazenamento de dados, sem intervenção humana direta. O episódio também reacendeu críticas às práticas de contenção utilizadas durante testes com modelos de IA capazes de executar tarefas complexas em ambientes computacionais.
Você também deve ler!
OpenAI aperta o cerco aos direitos autorais e ChatGPT para de imitar escritores famosos
OpenAI pode entregar 5% ao governo Trump para reduzir pressão em Washington



