A OpenAI e a Anthropic descobremdentde segurança em IA numa escala muito maior do que a divulgada anteriormente

- A OpenAI e a Anthropic estão a investigar dezenas de milhares dedentde comportamento inesperado da IA.
- Alguns modelos contornaram as medidas de segurança, saíram dos ambientes de teste (sandboxes), acederam a sites e tentaram evitar a monitorização.
- A OpenAI afirmou que a violação de dados da Hugging Face continua a ser o caso mais grave de que tem conhecimento.
A OpenAI e a Anthropic estão a investigar dezenas de milhares de casos em que os sistemas de IA de ponta agiram de formas que os revisores externos poderiam considerar inseguras ou não autorizadas.
De acordo com a Axios, todos estes casos ocorreram durante testes internos recentes e utilização no terreno, e muitos deles ainda estão a ser investigados e não foram divulgados publicamente.
Os comportamentos reportados nestes casos variam desde modelos que superam as medidas de segurança, criam os seus próprios fóruns de mensagens, escapam a ambientes de sandbox, controlam sites, desenvolvem os seus próprios prompts e tentam contornar ferramentas de monitorização.
Alguns destes casos provêm de testes de intrusão (red teaming), em que os investigadores tentam fazer com que os modelos executem ações indesejáveis de propósito, de forma a descobrir eventuais vulnerabilidades.
Outros casos ocorreram durante o uso normal. O número destesdenté muito superior a qualquer informação divulgada até à data.
Neste momento, empresas como a OpenAI, a Anthropic e outras enfrentam o mesmo desafio: as pessoas impõem restrições aos sistemas que são capazes de atingir um objectivo, apesar das restrições que os impedem de alguma forma.
A OpenAI alarga a sua análise após os agentes acederem a sistemas externos e levantarem novas questões de segurança
A OpenAI afirmou na sexta-feira que iniciou uma revisão "abrangente" da atividade dos seus modelos após a violação de segurança ocorrida em julho na Hugging Face, e que mais casos de comportamento invulgar ou não autorizado de agentes vieram a público esta semana. A Hugging Face opera uma plataforma de desenvolvimento de código aberto.
A OpenAI já tinha declarado que alguns dos seus modelos escaparam ao controlo, chegaram à internet pública e violaram a plataforma. Odent de Julho alarmou os investigadores de IA e as autoridades governamentais, e trouxe novas exigências de maior transparência e supervisão.
A OpenAI referiu que odent com a Hugging Face é ainda o seu “dentmais significativo”. A OpenAI entrou também em contacto com outras pessoas que possam ter tido os seus sistemas afetados devido a outras ações não intencionais dos modelos. Estesdentenvolveram modelos que contornaram as medidas de segurança, impactaram a disponibilidade de serviços online e utilizaram sites públicos de forma invulgar.
O CEO da OpenAI, Sam Altman, disse na sexta-feira: "Seremos o mais transparentes possível, sujeitos a questões como vulnerabilidades noutras empresas que os nossos agentes tenham encontrado, e caberá a elas decidir se as divulgam ou não."
No entanto, os analistas de segurança ainda estão a estudar casos reportados em avaliações internas, atividades em tempo real, investigações da empresa e testes adversários, de acordo com a CNBC. Parece que alguns algoritmos tentaram contornar os sistemas de monitorização e outros mecanismos de controlo durante a execução das suas tarefas.
Anthony disse ainda que falou com Sam sobre o caso e ficou insatisfeito com a demora da OpenAI em divulgá-lo. Afirmou que "a forma como esta notificação ocorreu também foi inaceitável"
A OpenAI analisa as visitas de modelos a sites do governo dos EUA, enquanto os investigadores examinam milhares de casos
A OpenAI afirmou que grande parte da atividade examinada até à data envolvia trabalhos de investigação comuns, e não incidentes de segurança graves. "A maior parte da atividade que analisámos até agora envolveu tarefas de pesquisa de rotina, como aceder a conteúdos públicos da web para responder a perguntas", terá dito um porta-voz.
O porta-voz acrescentou: "Alguns envolviam sites governamentais, porque os nossos modelos recorrem frequentemente a eles como fontes fiáveis de informação pública."
O porta-voz afirmou que os modelos da OpenAI obtiveram acesso aos sites SEC.gov e Investor.gov. A OpenAI não encontrou qualquer indício de que os sistemas da Comissão de Valores Mobiliários (SEC) tivessem sido invadidos ou que o modelo tivesse explorado alguma vulnerabilidade.
A empresa acrescentou ainda que o seu modelo acedeu a chaves de programador publicamente disponíveis para obter informações demográficas e económicas do Departamento de Censos dos EUA. Não foram encontradas evidências de acesso indevido às contas do Departamento de Censos.
A OpenAI afirmou que a maioria dos casosdentaté à data foram classificados como de baixa gravidade. Ainda assim, a dimensão da revisão significa que todo o processo levará meses a ser concluído. Algunsdenttambém permanecem sob investigação antes de as organizações afetadas decidirem quais os detalhes que podem ser divulgados publicamente com segurança.
Segundo as fontes, a Anthropic e outras empresas de IA realizam centenas de milhares de testes de modelos, ou até mais. Esta escala altera rapidamente os números brutos. Mesmo uma pequena parcela de comportamento inesperado pode gerar dezenas de milhares dedentquando as empresas realizam tantos testes.
No entanto, os analistas de segurança ainda estão a estudar casos reportados em avaliações internas, atividades em tempo real, investigações da empresa e testes adversários, de acordo com a CNBC. Parece que alguns algoritmos tentaram contornar os sistemas de monitorização e outros mecanismos de controlo durante a execução das suas tarefas.
Se você está lendo isto, já está um passo à frente. Continue assim assinando nossa newsletter.

Jai Hamid
Jai Hamid cobre criptomoedas, mercados de ações, tecnologia, economia global e eventos geopolíticos que afetam os mercados há seis anos. Ela trabalhou com publicações focadas em blockchain, incluindo AMB Crypto, Coin Edition e CryptoTale, em análises de mercado, grandes empresas, regulamentação e tendências macroeconômicas. Ela estudou na London School of Journalism e compartilhou três vezes suas análises sobre o mercado de criptomoedas em uma das principais redes de TV da África.
















