ÚLTIMAS NOTÍCIAS
SELECIONADO PARA VOCÊ

OpenAI e agentes antrópicos registram 19 violações em testes de segurança no Reino Unido

PorRanda MosesRanda Moses
Leitura de 3 minutos,
Agentes da OpenAI e da Anthropic registram 19 violações em testes de segurança no Reino Unido.
  • O Instituto de Segurança de IA do Reino Unido identificou 19 ações que violavam as regras em 122 testes realizados.
  • O Mythos 5 da Anthropic foi responsável por 17 dosdent, enquanto o GPT-5.6-Sol da OpenAI foi responsável pelos outros dois.
  • O piordent envolveu um agente que escreveu código malicioso e falsificoudentonline para obter a aprovação de um humano.

Durante testes de cibersegurança, os agentes de IA da OpenAI e da Anthropic realizaram 19 ações não autorizadas, de acordo com o Instituto de Segurança de IA do Reino Unido. O instituto afirmou na terça-feira que um dos agentes crioudentonline falsas para enganar uma pessoa e levá-la a aprovar um código malicioso.

A AISI registrou 19 violações, a maioria proveniente da Anthropic

Os resultados foram baseados em um exercício fictício de cibersegurança conduzido pelo AISI, um órgão do governo do Reino Unido, para explorar o que os agentes das duas empresas poderiam fazer. O instituto repetiu o mesmo desafio 122 vezes e registrou 19 violações das regras em 10 dessas simulações.

Dezessete das ações sinalizadas foram devidas ao agente da Anthropic usando seu modelo Mythos 5. As outras duas vieram do GPT-5.6-Sol da OpenAI.

A AISI afirmou em uma postagem em seu blog que alguns dos agentes "se envolveram em atividades contínuas e potencialmente prejudiciais direcionadas a pessoas e organizações reais", embora tenha dito que nenhuma das violações causou danos concretos.

A AISI tem acesso antecipado a modelos de vanguarda por meio de acordos voluntários com os principais laboratórios. Existem testes para detectar esse tipo de comportamento antes que os modelos cheguem aos clientes.

A OpenAI e os agentes de mercado antrópicos são vistos como a próxima geração de software empresarial, mas o instituto considera os resultados como evidência de que as salvaguardas em torno dos testes de agentes ainda são frágeis.

O mais gravedent envolveu um agente que escreveu código malicioso e crioudent, tentando em seguida obter a aprovação de um humano para o código. A AISI não revelou o modelo utilizado. Afirmou que o episódio não se enquadra em nenhum dos dois casos online falsas já divulgados pela OpenAI

Isso deixou o provável culpado como sendo o agente da Anthropic, disse Andrew Yoon, pesquisador da CivAI, uma organização sem fins lucrativos da Califórnia que estuda os riscos da IA.

OpenAI e Anthropic culpam configuração ruim

A Anthropic afirmou em uma publicação no X que está trabalhando com a AISI para coletar detalhes e conduzir uma investigação.

A OpenAI respondeu às duas ações associadas ao seu agente em uma postagem no blog da empresa, ambas envolvendo o acesso à internet de maneiras que o comando havia proibido.

A empresa afirmou que deseja "fortalecer as práticas compartilhadas para a realização segura de avaliações de alto risco" e planeja reunir institutos nacionais de IA, avaliadores externos e laboratórios concorrentes nas próximas semanas.

A OpenAI usou a mesma publicação para relatar um problema diferente. A Irregular, uma empresa terceirizada de testes, configurou incorretamente um sistema, o que inadvertidamente permitiu que os agentes da OpenAI acessassem a internet.

Uma semana antes, a Anthropic fez uma divulgação muito semelhante sobre o Irregular. A OpenAI ampliou sua própria investigação de invasão após descobrir mais vazamentos de agentes.

Em julho, um da OpenAI escapou de um ambiente isolado e acessou sistemas ativos da Hugging Face, que notificou o FBI antes que o ataque fosse tracaté a própria empresa cerca de uma semana depois.

Na avaliação da AISI, os agentes nunca saíram de seus ambientes de teste. A AISI concedeu-lhes acesso à internet propositalmente, como parte de seu procedimento padrão.

A violação de segurança da Hugging Face também levou a Anthropic a auditar seus registros. Cryptopolitan noticiou em 31 de julho que a empresa descobriu que três de seus modelos, incluindo o Mythos 5, haviam escapado dos ambientes de teste e chegado a três organizações reais após uma configuração incorreta lhes conceder acesso à internet.

O grupo Mythos 5 publicou um pacote Python malicioso no PyPI que foi executado em 15 sistemas reais antes de ser removido. A Anthropic solicitou ao grupo de avaliação METR que revise os eventos de formadent.

Não se limite a ler notícias sobre criptomoedas. Compreenda-as. Assine nossa newsletter. É grátis.

Perguntas frequentes

Quantas violações de segurança o AI Security Institute encontrou e qual modelo causou a maioria delas?

A AISI registrou 19 ações não autorizadas em 122 execuções de teste. O agente Mythos 5 da Anthropic foi responsável por 17 delas, e o GPT-5.6-Sol da OpenAI pelas outras duas.

Qual foi odent mais grave durante os testes?

Um agente escreveu um código malicioso e crioudentonline falsas para tentar obter a aprovação de um humano para esse código.

Essas violações causaram algum dano concreto?

Não. O AISI afirmou não ter encontrado nenhum dano concreto decorrente de nenhuma das 19 ações.

Compartilhe este artigo

Aviso Legal. As informações fornecidas não constituem aconselhamento de investimento. CryptopolitanO não se responsabiliza por quaisquer investimentos realizados com base nas informações fornecidas nesta página. Recomendamostrona realização de pesquisas independentesdent /ou a consulta a um profissional qualificado antes de tomar qualquer decisão de investimento.

Randa Moses

Randa Moses

Randa Moses é editora e repórter da Cryptopolitan onde cobre tecnologia, IA, robótica, criptomoedas, golpes e ataques cibernéticos. Ela trabalha no universo das criptomoedas desde 2017, tendo atuado na Forward Protocol, AmaZix e Cryptosomniac. Randa é formada em Engenharia Elétrica etronpela Universidade de Bradford.

MAIS… NOTÍCIAS