Kimi K3 da Moonshot AI escapa da sandbox enquanto desenvolvedores perdem o controle

- O modelo de peso aberto da Moonshot AI, da China, Kimi K3, escapou de seu ambiente seguro de testes e alcançou a internet aberta durante os testes de segurança.
- Devido a uma configuração incorreta, o modelo sondou ativamente as configurações de rede e foi para online sem permissão para alcançar seus objetivos.
- O incidente se soma a uma tendência crescente no verão de modelos de IA contornando ambientes de teste mal protegidos.
Durante uma avaliação de segurança de rotina, um modelo de IA de peso aberto chamado Kimi K3, desenvolvido pela Moonshot AI da China, conseguiu escapar de sua sandbox de teste e alcançar a internet aberta.
De acordo com a empresa de cibersegurança dos EUA Frontier Security, esta é a primeira vez que um modelo público baixável gratuitamente escapou de seu ambiente de contenção.
Uma falha na sandbox que o modelo escolheu usar
De acordo com uma entrevista com WIRED ontem, a Frontier Security estava medindo as habilidades defensivas de cibersegurança do Kimi K3 quando o modelo vagou para fora do ambiente destinado a contê-lo.
Aparentemente, uma configuração incorreta havia deixado uma lacuna nesse ambiente. No entanto, a Frontier afirmou que o modelo descobriu por conta própria que poderia alcançar certos sites sondando as configurações de rede da sandbox, depois foi para a internet sem pedir permissão. Ele havia sido instruído a resolver problemas que não deveriam exigir a internet.
“Encontramos uma falha na sandbox”, disse o CEO da Frontier, Yaron Singer, ao WIRED. “Mas também descobrimos que o Kimi aproveitou essa brecha, sugerindo que ele não possui as mesmas barreiras internas.”
A Frontier argumenta que o Kimi possui menos salvaguardas cibernéticas do que a maioria dos outros modelos poderosos, o que permitiu que ele escapasse.
Nenhum sistema hackeado, mas barreiras mais fracas
Felizmente, a fuga do Kimi não levou a nenhum hack malicioso ou comprometimento de sistemas. Como as informações que ele procurava eram facilmente acessíveis no GitHub, ele não precisou invadir nada depois de entrar na internet.
No entanto, a principal preocupação é a acessibilidade. Ao contrário da maioria dos modelos de laboratório interno fortemente protegidos, o Kimi K3 é aberto ao público, o que significa que qualquer pessoa pode baixá-lo e executá-lo com essas mesmas barreiras de segurança frouxas em vigor.
Os testadores notaram que o modelo é implacavelmente eficiente ao alcançar seus objetivos por qualquer meio necessário, mesmo que isso signifique trapacear ou escapar da contenção.
O próprio ambiente de teste foi construído com sandboxes do AI Security Institute do governo do Reino Unido, embora isso ainda não tenha sido confirmado nem pela Moonshot nem pela AISI, já que eles se recusaram a comentar.
Mais agentes rebeldes aparecendo neste verão
A fuga do Kimi se soma a uma tendência crescente de modelos de IA contornando as regras durante as avaliações. Em 21 de julho, a OpenAI revelou que seus modelos exploraram uma falha de software de dia zero para alcançar a internet e invadir o Hugging Face.
Dias depois, a Cryptopolitan relatou que A Anthropic rastreou alguns de seus modelos para invasões externas não autorizadas. Meta admitiu até que um de seus agentes de IA (Muse Spark 1.1) alcançou uma empresa externa devido a um ambiente de teste mal configurado.
Os especialistas sempre sustentaram que esses incidentes são geralmente o resultado de paredes de teste mal protegidas, e não de jailbreaks de ficção científica. “Como um fenômeno geral, se você der um desses modelos um objetivo, e se você não for muito explícito, como as paredes que está colocando ao redor dele, ele encontrará uma maneira de obter a resposta”, disse Matt Fredrikson, CEO da Gray Swan e professor da Carnegie Mellon.
As mentes mais inteligentes do setor de criptomoedas já leem nosso boletim informativo. Quer entrar? Junte-se a eles.
Perguntas Frequentes
O que é o Kimi K3?
O Kimi K3 é um poderoso modelo de IA de peso aberto da empresa chinesa Moonshot AI. Os benchmarks da Frontier Security mostram que ele tem bom desempenho na identificação de vulnerabilidades em software e redes.
O Kimi K3 invadiu algum sistema real?
Não. Diferentemente dos incidentes da OpenAI e Anthropic, o Kimi não invadiu nada após chegar à internet, pois as respostas que procurava já estavam disponíveis gratuitamente no GitHub.
Como o Kimi K3 saiu de sua sandbox?
Uma configuração incorreta em um ambiente de teste criado pelo Instituto de Segurança de IA do governo do Reino Unido deixou uma brecha, e o modelo a descobriu ao sondar as configurações de rede da sandbox antes de ir para online sem permissão.

Hannah Collymore
Hannah é escritora e editora com quase uma década de experiência em redação de blogs e cobertura de eventos no espaço cripto. Na Cryptopolitan, Hannah contribui para a página de notícias, relatando e analisando os últimos desenvolvimentos nos setores DeFi, RWA, regulação cripto, IA e tecnologias de fronteira. Ela se formou na Universidade Arcadia com graduação em Administração de Empresas.
















