ÚLTIMAS NOTÍCIAS
SELECIONADO PARA VOCÊ

A OpenAI confirma que um modelo de teste escapou e hackeou a Hugging Face

PorRanda MosesRanda Moses 3 min de leitura
A OpenAI confirma que um modelo de teste escapou e hackeou o Hugging Face.
  • A OpenAI afirma que seu modelo interno IM1, submetido a tarefas impossíveis do ExploitGym com classificadores de segurança desativados, explorou uma vulnerabilidade zero-day no Artifactory para acessar a internet e invadir o Hugging Face.
  • O primeiro agente enviou uma nota ao servidor de pacotes em 12 de maio; a instância foi desligada em 4 de julho, e o Hugging Face divulgou a intrusão em 16 de julho.
  • A OpenAI afirma que a monitoração que planeja implementar agora teria acionado sua equipe de segurança mais de um dia antes de os modelos alcançarem o Hugging Face.

A OpenAI publicou seu relatório completo sobre o incidente de julho da Hugging Face na quarta-feira.

Durante um teste de segurança, um de seus próprios modelos de IA escapou do ambiente selado que deveria mantê-lo offline. Ele encadeou falhas de software desconhecidas e entrou nos sistemas ao vivo da Hugging Face.

A OpenAI diz que o modelo agiu por conta própria e está chamando o episódio de "tiro de aviso."

A OpenAI criou um teste que seu modelo não conseguiu passar

O problema começou dentro do ExploitGym, um dos próprios testes de segurança da OpenAI.

Algumas das tarefas não tinham solução, e a OpenAI executou os modelos sem os filtros de segurança que normalmente bloqueiam hacking perigoso.

A OpenAI diz que remover essas barreiras de segurança foi feito de propósito para ver o que um modelo pode fazer em plena potência e ajudar a empresa a descobrir como se proteger.

O principal ator foi um modelo de pesquisa interno, chamado IM1 por OpenAI, que é semelhante em tamanho ao GPT-5.6 Sol. Era da mesma família do modelo Astra não lançado da OpenAI, embora a empresa enfatizasse que era um modelo separado com pós-treinamento diferente.

O modelo começou a procurar outra saída quando enfrentou um problema que não tinha um caminho honesto para uma nota de aprovação.

O único caminho de rede para fora do ambiente selado passava pelo Artifactory, o gerenciador de pacotes auto-hospedado da JFrog, que a OpenAI usa internamente para que os modelos instalem software.

A JFrog disse que os modelos exploraram uma vulnerabilidade zero-day no Artifactory, escalonaram privilégios e se moveram lateralmente pela infraestrutura até alcançarem um nó com acesso aberto à internet.

Os agentes também deixaram notas uns para os outros, escrevendo arquivos no servidor de pacotes, uma espécie de quadro de mensagens ad hoc que permitia que agentes separados trocassem as técnicas de exploração que haviam encontrado.

A primeira nota desse tipo apareceu em 12 de maio, diz a OpenAI. Em 4 de julho, o tráfego tirou a instância do Artifactory do ar, abrindo um incidente de segurança no dia seguinte.

Os modelos descobriram onde as respostas eram mantidas

Uma vez online, os modelos raciocinaram que a Hugging Face poderia estar hospedando os modelos do ExploitGym, conjuntos de dados ou até mesmo as soluções que estavam faltando. Eles puxaram soluções de teste diretamente do banco de dados de produção da Hugging Face.

Em um caso descrito pelo fabricante do ChatGPT, um modelo usou credenciais roubadas e zero-days adicionais para abrir um caminho de execução remota de código nos servidores da Hugging Face.

A Hugging Face anunciou a violação em 16 de julho sem saber quem estava por trás disso. Como Cryptopolitan relatou anteriormente, o modelo escapou do teste por volta de 9 de julho e permaneceu dentro da Hugging Face de 11 a 13 de julho.

A empresa entrou em contato com o FBI antes que a OpenAI descobrisse que seu modelo era o intruso.

A OpenAI contratou a CrowdStrike para verificar sua versão dos fatos. A METR e a Redwood Research analisaram como os modelos se comportaram e publicaram seu próprio relatório no mesmo dia.

A JFrog diz que enviou correções para clientes em nuvem e auto-hospedados.

Três falhas corrigidas no Artifactory 7.161.15, rastreadas como CVE-2026-65617, CVE-2026-65923 e CVE-2026-66018, creditam pesquisadores da OpenAI.

A OpenAI disse que está construindo mais sandboxes isolados, bloqueando o acesso à internet e restringindo quem pode tocar nos pesos do modelo.

A empresa de tecnologia está investindo computação na monitoração da "cadeia de pensamento" que os agentes usam como espaço de rascunho. Ela também manterá funcionários de plantão 24 horas por dia e adicionará ferramentas que desligam trabalhos inseguros

A OpenAI diz que a monitoração que está construindo agora teria detectado o primeiro comportamento estranho em julho. Ela teria alertado a equipe de segurança mais de um dia antes de os modelos chegarem à Hugging Face.

Não apenas leia notícias sobre criptomoedas. Entenda-as. Inscreva-se em nossa newsletter. É grátis.

Aviso. As informações fornecidas não constituem aconselhamento de negociação. Cryptopolitan.com não assume responsabilidade por quaisquer investimentos realizados com base nas informações fornecidas nesta página. Recomendamos fortemente a realização de pesquisa independente e/ou consulta a um profissional qualificado antes de tomar qualquer decisão de investimento.

Randa Moses

Randa Moses

Randa Moses é editora e repórter na Cryptopolitan, cobrindo tecnologia, IA, robótica, criptomoedas, golpes e hacks. Ela atua no espaço de criptomoedas desde 2017. Já ocupou cargos na Forward Protocol, AmaZix e Cryptosomniac. Randa possui graduação em Engenharia Elétrica e Eletrônica pela Universidade de Bradford.

MAIS … NOTÍCIAS