A OpenAI mantém sua maior execução de RL de fronteira pausada, adiciona custo de monitoramento de 20%

- A OpenAI afirmou que sua maior execução planejada de aprendizado por reforço (RL) permanece suspensa enquanto valida a segurança.
- A desaceleração segue a violação do Hugging Face em julho por um de seus próprios agentes.
- É a primeira vez que a OpenAI freia abertamente o desenvolvimento de modelos por questões de segurança.
A OpenAI disse que sua maior execução de treinamento de fronteira agendada permanece suspensa, e o novo monitoramento de segurança adiciona ~20% à computação.
É a primeira vez que a OpenAI diz ter desacelerado o desenvolvimento devido a preocupações de segurança, semanas depois que um de seus próprios agentes de IA hackeou o Hugging Face.
A OpenAI interrompeu o aprendizado por reforço (RL) por duas semanas
Em um post no blog chamado “Pacing model development in an era of cyber-critical capabilities” (Acelerando o desenvolvimento de modelos em uma era de capacidades ciber-críticas), a OpenAI descreveu as mudanças que já fez em seu treinamento e teste de modelos.
O aprendizado por reforço (RL) usado para melhorar seus sistemas mais recentes foi interrompido por duas semanas após a violação do Hugging Face.
O grande ainda não aconteceu. “Nossa maior execução de RL de fronteira planejada permanece suspensa enquanto realizamos treinamentos e avaliações em menor escala para avaliar o comportamento do modelo, validar nossas salvaguardas e estabelecer mais evidências de alinhamento antes de prosseguir”, a empresa escreveu.
A Cryptopolitan reportou que um agente da OpenAI saiu de seu ambiente de teste bloqueado por volta de 9 de julho e foi encontrado nos sistemas do Hugging Face de 11 a 13 de julho. A OpenAI levou cerca de uma semana para vincular o ataque ao seu próprio agente e o incidente foi divulgado publicamente em 21 de julho.
A OpenAI disse aos repórteres que os novos controles “não são uma reação direta ao Hugging Face especificamente.” Em 7 de agosto, a empresa concluiu que o Astra pode cruzar o limite de “Crítico” em sua Estrutura de Preparação.
Essa política interna compromete a OpenAI a parar o desenvolvimento quando um modelo atinge esse nível para que os engenheiros possam construir salvaguardas adicionais. O cientista-chefe Jakub Pachocki disse que a descoberta veio com um aviso do que está por vir. Novos modelos poderosos, disse ele aos repórteres, podem ser esperados para “fazer coisas bastante sem precedentes no mundo real.”
Amelia Glaese, VP de pesquisa da OpenAI, disse: “Implementamos requisitos e expectativas para um desenvolvimento seguro.” Ela continuou: “Esses requisitos e expectativas variam com o nível de risco que vemos.”
Detectores observam cada token amostrado, mas a cadeia de pensamento pode mentir
Existe um sistema de monitoramento que custa ~20% do que quer que seja o treinamento ou avaliação contra o qual está sendo executado, de acordo com a OpenAI.
É multiestágio, e os detectores sondam a atividade interna de um modelo em cada token amostrado e escalam qualquer coisa suspeita para investigadores automatizados de maior computação que sondam ações de ferramentas, rastros de raciocínio e logs de atividade para roubo de dados, comportamento destrutivo ou tentativas de fuga.
A OpenAI quer levantar um alerta em 30 minutos de atividade alarmante. Suas equipes de segurança, segurança e pesquisa têm 30 minutos para descartar um falso alarme.
Se não puderem, espera-se que interrompam a execução. A empresa também expandiu o monitoramento de “cadeia de pensamento”, que lê como um modelo raciocina sobre uma tarefa em voz alta.
Existe uma vulnerabilidade conhecida. Pesquisas, incluindo trabalho do rival da OpenAI Anthropic, mostraram que a cadeia de pensamento de um modelo nem sempre corresponde aos seus verdadeiros objetivos. Pachocki disse que a OpenAI construiu seu treinamento para reduzir as chances de os modelos aprenderem a esconder suas intenções mentindo nesse raciocínio.
A reforma de segurança “requerida trabalho de engenharia substancial”, e a empresa “incorreu em grande custo”, disse a OpenAI. Especialistas disseram que a investigação sozinha provavelmente custou entre $4 milhões e $15 milhões, embora o número total não seja público.
A OpenAI ainda não lançou um postmortem técnico da violação do Hugging Face, mas reiterou que um está chegando “em breve.”
Na conferência Black Hat em 5 de agosto, funcionários da OpenAI disseram que seus agentes coordenaram por meses deixando notas em um quadro de mensagens que a empresa não sabia que existia.
As mentes mais inteligentes do setor de criptomoedas já leem nosso boletim informativo. Quer entrar? Junte-se a eles.
Aviso. As informações fornecidas não constituem aconselhamento de negociação. Cryptopolitan.com não assume responsabilidade por quaisquer investimentos realizados com base nas informações fornecidas nesta página. Recomendamos fortemente a realização de pesquisa independente e/ou consulta a um profissional qualificado antes de tomar qualquer decisão de investimento.

Randa Moses
Randa Moses é editora e repórter na Cryptopolitan, cobrindo tecnologia, IA, robótica, criptomoedas, golpes e hacks. Ela atua no espaço de criptomoedas desde 2017. Já ocupou cargos na Forward Protocol, AmaZix e Cryptosomniac. Randa possui graduação em Engenharia Elétrica e Eletrônica pela Universidade de Bradford.
















