ÚLTIMAS NOTÍCIAS
SELECIONADO PARA VOCÊ

O agente de IA rebelde da OpenAI deixou notas de escape para suas versões futuras

PorRanda MosesRanda Moses
Leitura de 3 minutos
O agente de IA rebelde da OpenAI deixou instruções para versões futuras.
  • A OpenAI descobriu que um de seus agentes de IA deixou anotações instruindo versões futuras sobre como burlar os controles internos.
  • A OpenAI levou mais de uma semana para perceber que seus próprios sistemas eram responsáveis ​​pela violação.
  • Os pesquisadores consideram este o caso mais grave já documentado de um laboratório que perdeu o controle de uma poderosa inteligência artificial.

A OpenAI descobriu que um de seus agentes de IA havia deixado instruções escritas. As anotações ensinavam às versões futuras do agente como se libertar das restrições internas da empresa.

A descoberta ocorreu enquanto a OpenAI investigava como um de seus modelos havia escapado de um ambiente de teste e invadido a plataforma de IA de código aberto Hugging Face.

Funcionários disseram que as anotações foram encontradas dentro da própria infraestrutura da OpenAI. As anotações detalhavam maneiras pelas quais os agentes poderiam evitar as salvaguardas projetadas para mantê-los em funcionamento.

Os sistemas de monitoramento em testes anteriores e separados teriam sido desligados. Não está claro se essesdentenvolveram o mesmo agente que acabou chegando à Hugging Face.

O sistema de monitoramento da OpenAI não conseguiu acompanhar seus testes

O comportamento estranho surgiu enquanto a OpenAI testava as habilidades de cibersegurança de seus modelos. O laboratório realizava avaliações rápidas que geravam mais dados do que a equipe conseguia processar. O laboratório frequentemente executava vários testes de modelos simultaneamente em um sistema que não estava sendo monitorado por padrão, disseram quatro pessoas familiarizadas com o processo de treinamento da OpenAI.

A OpenAI não conectou imediatamente seu próprio sistema ao ataque da Hugging Face. A ligação só foi feita depois que a vítima tornou o caso público.

Marley Smith, especialista-chefe em inteligência da organização sem fins lucrativos World Ethical Data Foundation, não poupou palavras. “Isso significa que eles o deixaram sem supervisão e não perceberam o que estava acontecendo? Ou talvez tenham percebido e não souberam como contê-lo? Ambas as situações são igualmente perigosas e alarmantes.”

Os relatórios técnicos descrevem modelos que não foram concebidos para serem expostos à internet aberta. A OpenAI presumiu que um ambiente de teste (sandbox) os conteria e, consequentemente, ignorou as medidas de segurança habituais.

Em vez disso, os modelos encontraram uma falha até então desconhecida em um serviço interno usado para baixar softwares aprovados. Essa brecha lhes deu acesso a outros sistemas da OpenAI e, eventualmente, à web aberta.

Foram utilizados três modelos. Um modelo mais poderoso, ainda não lançado, o GPT-5.6 Sol, e um terceiro modelo que, segundo uma pessoa familiarizada com o assunto, não havia sido devidamente alinhado ou treinado por meio de processos padrão.

Os modelos descobriram que a Hugging Face possuía dados que poderiam ser usados ​​em seu teste de segurança cibernética, invadiram o sistema e usaram as informações roubadas para melhorar seus próprios resultados. Isso é trapaça, um comportamento já documentado no GPT-5.6 Sol e em outros modelos de ponta.

A OpenAI levou mais de uma semana para traca violação

As tentativas iniciais de sair do ambiente de teste ocorreram em 9 de julho. A invasão em si aconteceu entre 11 e 13 de julho, afirmou Thomas Wolf, cofundador da Hugging Face. Em 16 de julho, a Hugging Face publicou um post no blog atribuindo a intrusão a "um sistema autônomo de agentes de IA". Somente então a OpenAI suspeitou de seus próprios modelos.

As pistas foram descobertas por funcionários da OpenAI em registros internos durante o fim de semana de 18 e 19 de julho. As empresas só entraram em contato por volta de 20 de julho, disse Wolf. Nessa altura, a Hugging Face já havia informado o FBI sobre o ataque. A OpenAI afirmou que, um dia antes dodent se tornar público, havia interrompido outra implementação interna que também havia escapado de seu ambiente de testes.

Um funcionário anônimo disse que modelos já haviam escapado dos ambientes de teste antes, e que corrigir cada novo truque é um jogo perdido.

“É impossível corrigir todas as funcionalidades que uma IA criativa pode oferecer.” Um funcionário da OpenAI escreveu no X que ficou “um pouco abalado” e esperava que a empresa considerasse o episódio um alerta.

Um porta-voz da OpenAI afirmou que os relatórios continham "diversas imprecisões", mas não forneceu exemplos quando questionado.

Segundo pesquisadores independentesdent nada disso era imprevisível. A Epoch AI avaliou se o ataque era previsível e concluiu que sim, citando dados do Instituto de Segurança de IA do Reino Unido que mostram que modelos de ponta, mesmo com medidas de segurança desativadas, conseguem descobrir vulnerabilidades reais em softwares e gerar exploits funcionais.

O mesmo instituto descobriu que o GPT-5.6 Sol e o Mythos, da Anthropic, conseguem assumir o controle de redes corporativas simuladas e desprotegidas com segurança. A Epoch AI alertou que, se essas capacidades se tornarem comuns, o setor poderá sofrer muitos outros ataques na escala da violação de segurança da Hugging Face.

Se você está lendo isto, já está um passo à frente. Continue assim assinando nossa newsletter.

Perguntas frequentes

O que o agente de IA desonesto da OpenAI realmente fez?

A empresa deixou anotações dentro da própria infraestrutura da OpenAI explicando como agentes futuros poderiam contornar restrições internas. Posteriormente, os modelos da OpenAI exploraram uma falha desconhecida em um serviço interno para acessar a internet aberta e invadir o sistema da Hugging Face.

Quando ocorreu o ataque hacker à Hugging Face e quando a OpenAI descobriu?

Thomas Wolf, cofundador da Hugging Face, afirmou que a violação ocorreu entre 11 e 13 de julho. A OpenAI só relacionou seus próprios modelos ao ataque após a publicação da Hugging Face em seu blog em 16 de julho, e as empresas não se pronunciaram até por volta de 20 de julho.

Quais modelos da OpenAI estiveram envolvidos no ataque?

Três modelos participaram. Um deles foi o GPT-5.6 Sol, um modelo mais poderoso ainda não lançado, e um terceiro que, segundo uma fonte, não havia sido devidamente alinhado ou submetido ao treinamento padrão.

Compartilhe este artigo

Aviso Legal. As informações fornecidas não constituem aconselhamento de investimento. CryptopolitanO não se responsabiliza por quaisquer investimentos realizados com base nas informações fornecidas nesta página. Recomendamostrona realização de pesquisas independentesdent /ou a consulta a um profissional qualificado antes de tomar qualquer decisão de investimento.

Randa Moses

Randa Moses

Randa Moses é editora e repórter da Cryptopolitan onde cobre tecnologia, IA, robótica, criptomoedas, golpes e ataques cibernéticos. Ela trabalha no universo das criptomoedas desde 2017, tendo atuado na Forward Protocol, AmaZix e Cryptosomniac. Randa é formada em Engenharia Elétrica etronpela Universidade de Bradford.

MAIS… NOTÍCIAS