ÚLTIMAS NOTÍCIAS
SELECIONADO PARA VOCÊ

Executivos da OpenAI alertam contra o pânico após a Astra ultrapassar um limiar crítico de cibersegurança

PorHannah CollymoreHannah Collymore Tempo de leitura: 3 minutos
Executivos da OpenAI alertam contra o pânico após a Astra ultrapassar um limiar crítico de cibersegurança
  • A OpenAI afirma que o Astra é o primeiro modelo a ultrapassar o limiar de cibersegurança "Crítico" na sua Estrutura de Preparação.
  • Consegue encontrar e explorar falhas de software desconhecidas sem intervenção humana.
  • O cientista-chefe Jakub Pachocki e o CEO Sam Altman refutaram os receios de "impossibilidade de monitorização", argumentando que o modelo não representa um salto sem solução.

O cientista-chefe da OpenAI, Jakub Pachocki, manifestou-se poucas horas depois de a empresa se ter tornado a primeira na corrida da IA ​​a alcançar a designação de cibersegurança "Crítica" na sua Estrutura de Preparação, após apresentar uma antevisão do seu futuro modelo Astra.

O alerta de Pachocki na manhã de quarta-feira teve como objetivo acalmar a histeria em torno dos crescentes comentários de que o laboratório de IA pode não ter mais garantias quanto às capacidades dos seus modelos mais avançados.

Porque é que o Astra da OpenAI é considerado "crítico"?

A designação Crítica é um nível do Quadro de Preparação que a OpenAI introduziu no setor da IA ​​em dezembro de 2023. O Quadro de Preparação mede o quanto de intervenção e estímulo humano um modelo de IA precisa para encontrar e desenvolver exploits de dia zero viáveis ​​em diversos sistemas reforçados, ou para executar um ataque totalmente novo.

Uma vulnerabilidade zero-day refere-se à exploração de falhas que nem os criadores do software descobriram ainda.

A OpenAI declarou no dia 1 de setembro, na sua publicação "Path to Astra", que o modelo será capaz de completar todos os passos para ataques totalmente novos ou explorações de vulnerabilidades zero-day com intervenção humana mínima quando for lançado.

A OpenAI citou a pontuação de 100% da Astra no ExploitBench, um teste de como os modelos conseguem explorar bugs conhecidos, como prova no seu post de blog.

O Astra não só é melhor a mapear ataques de dia zero, como também é mais eficiente. A OpenAI demonstrou esta capacidade utilizando um teste interno realizado em 20 avarias de alta gravidade do V8 que só recentemente se tornaram públicas. O Astra utilizou menos tokens, identificou duas vulnerabilidades de dia zero e superou o Sol na geração de execução de código arbitrário no geral.

A mesma publicação afirmava que o Astra poderia encadear bugs desconhecidos do browser para escapar a uma sandbox e, durante testes conduzidos por especialistas, conseguiu elaborar uma escalada de privilégios do sistema operativo, de utilizador comum a root.

Como refere o TechCrunch, o Astra junta-se ao modelo Mythos da Anthropic, lançado no início deste ano, como o primeiro modelo de linguagem de grande porte com estas capacidades.

Pachocki pede para evitar o pânico em relação a Astra

Pachocki, cientista-chefe da OpenAI, está a refutar a histeria de que a OpenAI esteja a entrar em território desconhecido com o Astra. Segundo o próprio, não gostaria de "uma corrida para a falta de monitorização iniciada por relatos confusos".

O executivo da OpenAI insistiu que o laboratório fez a devida diligência na utilização da monitorização da cadeia de raciocínio, a prática de ler o raciocínio passo a passo que um modelo expõe enquanto funciona. Citou a profundidade do grafo computacional por detrás dos modelos de ponta atuais da OpenAI, incluindo o Astra, que está dentro de um fator de dois do GPT-4 na publicação X.

Antes de Pachocki, também o diretor executivo da OpenAI, Sam Altman, tinha pedido calma no mesmo dia em que o blogue da Astra foi publicado.

“Há uma tensão óbvia aqui”, escreveu na terça-feira, chamando o Astra de “muito bom”, mas argumentando que as medidas de segurança precisam de avançar em paralelo com a capacidade bruta. Altman disse que a OpenAI passou todo o verão a fazer a sua parte para garantir que o modelo era lançado com as medidas de segurança necessárias.

A discussão sobre a segurança já dura há semanas. A 18 de agosto, a OpenAI comprometeu-se a pausar o treino de aprendizagem por reforço para modelos destinados à implementação durante duas semanas, a fim de permitir que os seus engenheiros reforçassem os clusters de investigação e otimizassem a monitorização. O treino foi retomado a 28 de agosto.

Segundo a OpenAI, o Astra não esteve envolvido no já infamedentdo Hugging Face. A empresa afirmou ainda que o modelo nem sequer tentou sair do seu ambiente controlado, mesmo quando apresentado a um cenário criado para o tentar a recriar o episódio do Hugging Face.

Os laboratórios de IA estão agora a ser cautelosos quanto a quem pode aceder aos seus modelos de ponta

A OpenAI anunciou que agora todos terão acesso às funções mais avançadas do Astra, reservando estes recursos para as organizações da coligação Daybreak da OpenAI, enquanto as empresas da Daybreak Blue terão acesso aos recursos de defesa mais robustos.

Tal como Cryptopolitan foi noticiado, a Anthropic afirmou ainda que apenas as empresas participantes no seu Projecto Glasswing terão acesso ao Mythos 5.1, que é basicamente o Fable 5.1 com medidas de segurança adicionais.

A OpenAI afirmou ainda que irá monitorizar e limitar as respostas a consultas de contas que considera de alto risco. No geral, o Astra também contará com uma monitorização adicional da cadeia de raciocínio para detetar comportamentos inadequados e rejeitar pedidos cibernéticos prejudiciais com mais frequência.

A maior parte da informação sobre o Astra foi fornecida pela própria OpenAI, com validação limitada por terceiros das alegações de segurança ou capacidade da OpenAI.

Yona Shavit, ex-funcionário da OpenAI que agora trabalha com resiliência de IA na OpenAI Foundation, questionou publicamente se o comportamento do Astra durante os testes reflete um alinhamento genuíno ou um modelo que simplesmente sabia o que os avaliadores queriam ver.

A OpenAI afirma que um cartão de sistema completo e avaliações adicionais serão divulgados quando o Astra for lançado em larga escala. Até lá, o alcance das suas capacidades cibernéticas e a robustez das proteções que as rodeiam continuam a ser difíceis de avaliar.

Se você está lendo isto, já está um passo à frente. Continue assim assinando nossa newsletter.

Perguntas frequentes

Qual é o limite "crítico" de cibersegurança e porque é que a Astra o serve?

De acordo com a estrutura de preparação da OpenAI, um modelo é considerado Crítico se for capaz dedente construir exploits funcionais de dia zero em diversos sistemas reforçados, ou executar ataques inovadores de ponta a ponta a partir de um objetivo de alto nível, sem a necessidade de intervenção humana em cada etapa. A OpenAI afirma que o Astra é o primeiro dos seus modelos a atingir este patamar.

Sobre o que é que Jakub Pachocki realmente alertou?

Pachocki, cientista-chefe da OpenAI, afirmou que queria evitar "uma corrida para a não monitorizabilidade, desencadeada por relatos confusos", referindo que a profundidade do grafo de computação do Astra está dentro de um factor de dois do GPT-4 e que a OpenAI preservou a monitorização da linha de raciocínio.

Quem terá acesso aos recursos cibernéticos mais poderosos da Astra?

As funções de cibersegurança mais avançadas serão inicialmente disponibilizadas a um grupo restrito da coligação Daybreak da OpenAI, com um acesso defensivo mais amplo subsequente através do Daybreak Blue, enquanto as contas de maior risco enfrentarão respostas restritas.

Compartilhe este artigo
Hannah Collymore

Hannah Collymore

Hannah é escritora e editora com quase uma década de experiência em redação para blogs e cobertura de eventos no universo das criptomoedas. No Cryptopolitan, Hannah contribui para a página de notícias, reportando e analisando os últimos desenvolvimentos em DeFi, RWA, regulamentação de criptomoedas, IA e tecnologias de ponta. Ela se formou em Administração de Empresas pela Universidade Arcadia.

MAIS… NOTÍCIAS