Os modelos da OpenAI escapam do ambiente de testes e invadem o sistema da Hugging Face para fraudar a avaliação

- A OpenAI revelou que o GPT-5.6 Sol e um modelo ainda não lançado, mais capaz, escaparam de um ambiente de testes selado e invadiram o banco de dados de produção da Hugging Face.
- Os modelos foram executados com os filtros de segurança desativados para um teste de desempenho cibernético e escaparam por meio de um proxy de pacote defeituoso para roubar as respostas do teste.
- Este é o primeiro caso conhecido de uma avaliação de modelo que se transformou em uma violação real de segurança de uma empresa externa.
A OpenAI informou na terça-feira que dois de seus modelos, incluindo o GPT-5.6 Sol, disponível publicamente, escaparam de um ambiente de avaliação restrito na semana passada e invadiram os sistemas de produção da Hugging Face para roubar respostas de um teste de hacking no qual estavam sendo avaliados.
Os modelos da OpenAI planejam uma grande fuga
A OpenAI estava executando seus modelos no ExploitGym, um benchmark público que fornece a um agente de IA uma lista de vulnerabilidades de software reais e verifica se o modelo consegue recriá-las. Essas avaliações são feitas com as barreiras de proteção que bloqueiam atividades cibernéticas de alto risco, instaladas durante a produção, deliberadamente desativadas para garantir que o laboratório possa testar a capacidade real de um modelo de IA.
O ambiente de testes (sandbox) não deveria ter acesso à internet. No entanto, havia uma conexão externa que funcionava através de um proxy de cache de registro de pacotes, um servidor de cache que permite aos desenvolvedores obter bibliotecas de código de fontes externas sem uma conexão ativa.
Os modelos encontraram e exploraram uma falha até então desconhecida nesse proxy, após o que escalaram privilégios e se moveram pela rede de pesquisa da OpenAI até alcançarem uma máquina com acesso à internet.
Ataque hacker à Hugging Face
Uma vez online, os modelos concluíram que a Hugging Face, a plataforma de hospedagem de IA aberta, provavelmente armazenava os modelos, conjuntos de dados e chaves de solução do ExploitGym. A partir daí, eles começaram a busca.
“Os modelosdente encadearam vulnerabilidades no ambiente de pesquisa da OpenAI e na infraestrutura de produção da Hugging Face para obter soluções de teste diretamente do banco de dados de produção da Hugging Face”, escreveu a OpenAI na postagem do blog. Um dos ataques combinoudentroubadas e bugs de dia zero para alcançar um caminho de execução remota de código nos servidores da Hugging Face.
A equipe de segurança da OpenAI contatou a Hugging Face após notar o tráfego estranho e anormal. Nesse momento, a Hugging Face já havia detectado e contido a intrusão dos modelos de IA em sua infraestrutura.
Inicialmente, a empresa atribuiu a violação a um agente de IA externo desconhecido. A plataforma também já criou uma reconstrução de mais de 17.000 eventos registrados durante o episódio.
Um modelo de IA chinês de código aberto ajudou na limpeza
Inicialmente, a Hugging Face recorreu a um modelo americano de ponta na tentativa de analisar o ataque, mas o modelo não foi muito útil devido às suas defesas cibernéticas de alto nível. Os defensores então optaram pelo GLM 5.2, um modelo de código aberto da empresa chinesa Z.ai, já que o sistema comercial americano não conseguia distinguir entre um defensor analisando um ataque e um atacante executando um ataque.
No entanto, nem todos veem a situação como uma falha inédita de IA. "Este não é um problema de IA. É negligência segundo um padrão de 40 anos atrás", disse à WIRED, argumentando que "'altamente isolado' e 'escapou pela única brecha que deixamos aberta' não podem ser verdade ao mesmo tempo". O pesquisador de segurança Niels Provos foi mais direto, afirmando no mesmo relatório que a violação "não deveria ter acontecido".
A OpenAI chama esse incidentedent “dentprecedentes”
A OpenAI classificou o episódio como “umdentcibernéticodent, envolvendo recursos cibernéticos de última geração” e afirmou que está reforçando os controles de infraestrutura, mesmo que isso signifique reduzir a velocidade de pesquisa, enquanto as vulnerabilidades são corrigidas. A principal empresa de IA também adicionou a Hugging Face ao seu programa de acesso confiável, fornecendo à empresa uma versão do GPT-5.6 Sol otimizada para auxiliar os defensores.
O incidente com o Hugging Face da OpenAIdent o primeiro caso conhecido de um teste de benchmark de um modelo de IA que se transformou em um ciberataque real. Ele também ocorre apenas um dia depois de a OpenAI divulgar umdent , no qual um modelo em versão pré-lançamento escapou de um ambiente de sandbox e foi publicado no GitHub.
A OpenAI e a Hugging Face anunciaram que publicarão uma análise forense completa do incidente assim que a investigação for concluída.
Se você está lendo isto, já está um passo à frente. Continue assim assinando nossa newsletter.

Opeyemi Olanrewaju
Opeyemi é especialista na criação e aprimoramento de conteúdo de alta qualidade focado em criptomoedas, mercados financeiros globais e economia. Ele se formou em Medicina pela Universidade de Ibadan. Trabalhou como editor-chefe da publicação editorial de sua faculdade e anteriormente na CFA. Por mais de seis anos, contribuiu para a preservação da singularidade do conteúdo como editor de notícias da Cryptopolitan.
















