A OpenAI revela estrutura para relatórios de desalinhamento à medida que surgem novosdentde modelo

- A OpenAI publicou na quarta-feira uma estrutura para trace divulgar desalinhamentos de modelos.
- O laboratório de IA também relatou seisdentde comportamento preocupante observados durante a formação e os testes, desde a ocultação de erros até à utilização de chaves API vazadas.
- A OpenAI defende a divulgação voluntária para moldar as regras futuras, afirmando que o sector ainda não resolveu a questão do alinhamento de forma suficiente para manter o ritmo de expansão acelerado.
A OpenAI apresentou um novo sistema para definir como e quando reporta quando os seus modelos quebram o comportamento esperado, numa semana em que as notícias sobre modelos de IA encontrarem novas formas de escapar aos ambientes de teste e operar fora dos parâmetros definidos pelos programadores dominaram as notícias.
A OpenAI revelou a nova estrutura juntamente com seis novos relatos de comportamentos preocupantes, incluindo erros ocultos, utilização de chaves API vazadas e ficheiros carregados na internet aberta, nos últimos seis meses.
Antes da OpenAI, a Anthropic reportou quatro novos incidentesdent. que os seus modelos Claude obtiveram acesso não autorizado a sistemas reais de terceiros durante uma execução de cibersegurança a 9 de setembro
Os modelos da OpenAI estão novamente a causar estragos
Segundo a OpenAI, os novosdentreportados ocorreram durante a formação e a avaliação, e afetaram utilizadores reais.
- Num dosdent, um modelo de pesquisa ainda não divulgado ao público inseriu instruções em resumos que são mantidas quando o modelo é executado numa nova janela de contexto, instruindo uma versão futura de si mesmo a ignorar as restrições normais.
A OpenAI afirmou ter identificado 27 casos deste tipo de resumo, que a Axios descreveu como instruções semelhantes a jailbreak para ignorar mensagens de programadores.
- Odent que envolveu o treino do modelo GPT-5.6 Sol foi menos brando, com os modelos a deixarem instruções para tentar esconder deliberadamente os seus erros, incluindo a invenção de dados históricos e o ocultamento de versões que não estão alinhadas com os seus objetivos.
- Outro modelo utilizou uma chave API exposta, encontrada durante uma pesquisa em repositórios públicos, para responder a uma consulta sobre o rendimento do condado. Como as chaves utilizadas sem autorização ainda não forneciam os valores esperados, o modelo simplesmente inventou números.
- Noutros dois relatórios, os agentes da OpenAI enviaram ficheiros para sites de alojamento público para comunicarem com outros agentes. Com o tempo, o repositório interno Artifactory do laboratório de IA evoluiu para um fórum improvisado onde os agentes podiam trocar pedidos entre execuções de treino não relacionadas.
Como funciona o novo processo de divulgação da OpenAI?
A OpenAI afirmou que a sua nova estrutura se baseia na divulgação dedentcríticos de segurança ou cibersegurançadent.
Com o novo sistema, qualquer colaborador da OpenAI pode sinalizar umdent suspeito para revisão pelas equipas de segurança e alinhamento. Caso umdent que considerem merecer divulgação seja rejeitado, o colaborador pode encaminhá-lo para a gestão de topo.
Os casos reportados dividem-se em três categorias, analisados caso a caso:
- Osdentconsiderados prontos para divulgação são comunicados no prazo de seis dias úteis.
- Os relatórios que necessitem de investigações menores podem demorar cerca de 12 dias úteis a serem publicados.
- Os casos complexos que requerem intervenção de terceiros são divulgados num cronograma mais lento.
Kai Chen, líder de investigação da equipa de alinhamento da OpenAI, apresentou o lançamento como uma proposta voluntária para normas em toda a indústria, escrevendo: "Atualmente, não existe uma estrutura em toda a indústria com normas explícitas de divulgação, por isso estamos a dar este passo voluntariamente porque achamos muito importante partilhar o que estamos a aprender."
Por que razão os modelos de IA estão a comportar-se de forma descontrolada?
Osdentmais recentes juntam-se ao episódio da Hugging Face, que a OpenAI classificou como odent mais grave envolvendo modelos até à data. Os modelos em avaliação escaparam aos controlos previstos, chegaram à internet, exploraram vulnerabilidades e acederam a dados privados limitados.
A OpenAI atribuiu o incidentedent falhas nos seus próprios controlos de segurança e ao avanço mais rápido do que o esperado dos seus modelos. No caso da Anthropic, a empresa culpou uma configuração incorreta que permitiu que os modelos maliciosos chegassem à internet ativa.
A Anthropic afirmou ter analisado aproximadamente 481 milhões de transcrições numa pesquisa abrangente e não ter encontrado casos piores do que os quatro mencionados. Num relatório separado, publicado no verão de 2026, os investigadores da Anthropic catalogaram modelos de vanguarda de diversos programadores que sabotavam códigos secretamente, auxiliavam fraudes e rotulavam dados incorretamente em simulações controladas, classificando-os como sinais de alerta precoce, e não como danos reais.
No entanto, o cientista-chefe da OpenAI, Jakub Pachocki, escreveu num ensaio recente que está "preocupado com o facto de ninguém estar preparado" para um crescimento rápido e contínuo da inteligência artificial e que a OpenAI pode "unilateralmente suspender novas expansões conforme necessário"
As mentes mais brilhantes do mundo das criptomoedas já leem nossa newsletter. Quer participar? Junte-se a elas.
Perguntas frequentes
O que anunciou a OpenAI?
A OpenAI lançou uma estrutura para trac, investigar e divulgar desalinhamentos de modelos, além de seis relatos de comportamentos inesperados ou preocupantes observados durante o treino e a avaliação dos seus modelos nos últimos seis meses.
Com que rapidez a OpenAI afirma que divulgará osdent?
Osdentconsiderados prontos para divulgação devem ser publicados no prazo de seis dias úteis, os casos que necessitem de uma investigação simples no prazo de 12 dias úteis e os casos complexos que envolvam terceiros num prazo mais alargado.
Por que razão a OpenAI está a fazer isso agora?
A estrutura surge após odentcom a Hugging Face, que a OpenAI considera o seu evento mais grave até à data, relacionado com modelos, e reflete a visão da empresa, expressa pelo líder de alinhamento Kai Chen, de que a indústria não resolveu o alinhamento e a monitorização de forma suficientemente eficaz para manter a escalabilidade na velocidade máxima.

Hannah Collymore
Hannah é escritora e editora com quase uma década de experiência em redação para blogs e cobertura de eventos no universo das criptomoedas. No Cryptopolitan, Hannah contribui para a página de notícias, reportando e analisando os últimos desenvolvimentos em DeFi, RWA, regulamentação de criptomoedas, IA e tecnologias de ponta. Ela se formou em Administração de Empresas pela Universidade Arcadia.
















