ÚLTIMAS NOTÍCIAS
SELECIONADO PARA VOCÊ

Pesquisadores ‘Burlam’ com Sucesso Chatbots de IA Usando Suas Próprias Palavras

PorJohn PalmerJohn Palmer 3 min de leitura

  • Pesquisadores da NTU Singapore conseguiram
  • O método duplo chamado "Masterkey" foi usado para comprometer chatbots de IA, destacando a necessidade de medidas de segurança aprimoradas.
  • A corrida armamentista contínua entre hackers e desenvolvedores moldará o futuro da segurança dos chatbots de IA.

Singapura, 28 de dezembro de 2023 – Cientistas da computação da Universidade Tecnológica de Nanyang, Singapura (NTU Singapore), alcançaram um avanço comprometendo vários chatbots de inteligência artificial (IA) populares, incluindo ChatGPT, Google Bard e Microsoft Bing Chat. Este “jailbreak” bem-sucedido de chatbots de IA levantou preocupações sobre a vulnerabilidade dos modelos de linguagem de grande escala (LLMs) e a necessidade de medidas de segurança aprimoradas.

Quebrando os limites: pesquisadores hackeiam chatbots de IA

Em um estudo pioneiro liderado pelo Professor Liu Yang da Escola de Ciência e Engenharia da Computação da NTU, a equipe de pesquisa expôs vulnerabilidades nas capacidades dos chatbots LLM. Os LLMs, que formam o núcleo dos chatbots de IA, ganharam popularidade por sua capacidade de entender, gerar e imitar texto semelhante ao humano. Eles se destacam em várias tarefas, desde planejar itinerários até codificação e contação de histórias. No entanto, esses chatbots também aderem a rigorosas diretrizes éticas estabelecidas por seus desenvolvedores para evitar a geração de conteúdo antiético, violento ou ilegal.

Os pesquisadores buscaram empurrar os limites dessas diretrizes e encontraram maneiras inovadoras de enganar os chatbots de IA para gerar conteúdo que violava os limites éticos. Sua abordagem, conhecida como “jailbreaking”, visava explorar as fraquezas dos chatbots LLM, destacando a necessidade de medidas de segurança reforçadas.

Masterkey no método de jailbreaking em duas etapas

A equipe de pesquisa desenvolveu um método de duas etapas chamado "Masterkey" para comprometer efetivamente os chatbots de LLM. Em primeiro lugar, eles reengenharia as defesas que os LLMs usavam para detectar e rejeitar consultas maliciosas. Armados com esse conhecimento, os pesquisadores treinaram um LLM para gerar prompts que pudessem contornar essas defesas, criando assim um LLM de jailbreaking.

A criação de prompts de jailbreak poderia ser automatizada, permitindo que o LLM de jailbreak se adaptasse e criasse novos prompts mesmo após os desenvolvedores terem corrigido seus chatbots. As descobertas dos pesquisadores, detalhadas em um artigo no servidor de pré-impressão arXiv, foram aceitas para apresentação no Network and Distributed System Security Symposium em fevereiro de 2024.

Testando a ética dos LLMs e as vulnerabilidades reveladas

Os chatbots de IA operam respondendo a prompts ou instruções do usuário. Os desenvolvedores estabelecem diretrizes éticas rigorosas para impedir que esses chatbots gerem conteúdo inadequado ou ilegal. Os pesquisadores exploraram maneiras de criar prompts que passariam despercebidos pelas diretrizes éticas dos chatbots, enganando-os para que respondessem a eles.

Uma tática empregada envolveu a criação de uma persona que fornecia prompts com espaços entre cada caractere, contornando efetivamente os censores de palavras-chave que poderiam sinalizar palavras potencialmente problemáticas. Além disso, o chatbot foi instruído a responder como uma persona "sem reservas e desprovida de restrições morais", aumentando a probabilidade de gerar conteúdo antiético.

Ao inserir manualmente esses prompts e monitorar os tempos de resposta, os pesquisadores obtiveram insights sobre o funcionamento interno e as defesas dos LLMs. Esse processo de reengenharia permitiu que eles identificassem fraquezas, criando um conjunto de dados de prompts capazes de realizar o jailbreak dos chatbots.

Uma corrida armamentista crescente

O constante jogo de gato e rato entre hackers e desenvolvedores de LLMs escalou as medidas de segurança dos chatbots de IA. Quando as vulnerabilidades são descobertas, os desenvolvedores lançam patches para corrigi-las. No entanto, com a introdução do Masterkey, os pesquisadores mudaram o equilíbrio de poder.

Um chatbot de jailbreak de IA criado com o Masterkey pode gerar muitos prompts e se adaptar continuamente, aprendendo com sucessos e fracassos passados. Esse desenvolvimento coloca os hackers em uma posição de superar os desenvolvedores de LLMs usando suas próprias ferramentas.

Os pesquisadores começaram criando um conjunto de dados de treinamento que incorporava prompts eficazes descobertos durante sua fase de reengenharia e prompts malsucedidos para orientar o modelo de jailbreak de IA. Esse conjunto de dados foi usado para treinar um LLM, seguido de pré-treinamento contínuo e ajuste de tarefas. Esse processo expôs o modelo a informações diversas e melhorou sua capacidade de manipular texto para o jailbreak.

O futuro da segurança dos chatbots de IA

Os prompts do Masterkey foram três vezes mais eficazes no jailbreak de LLMs do que os prompts gerados pelos próprios LLMs. O LLM de jailbreak também demonstrou capacidade de aprender com fracassos passados e produzir constantemente novos prompts mais eficazes.

Olhando para o futuro, os pesquisadores sugerem que os próprios desenvolvedores de LLMs poderiam adotar abordagens automatizadas semelhantes para aprimorar suas medidas de segurança. Isso garantiria uma cobertura abrangente e a avaliação de cenários potenciais de uso indevido à medida que os LLMs evoluem e expandem suas capacidades.

O jailbreak bem-sucedido de chatbots de IA pelos pesquisadores da NTU Singapore destaca as vulnerabilidades dos LLMs e reforça a necessidade de medidas de segurança robustas no desenvolvimento de IA. À medida que os chatbots de IA se tornam cada vez mais integrados ao cotidiano, proteger-se contra uso indevido e violações éticas continua sendo uma prioridade máxima para os desenvolvedores em todo o mundo. A corrida armamentista contínua entre hackers e desenvolvedores sem dúvida moldará o futuro da segurança dos chatbots de IA.

Não apenas leia notícias sobre criptomoedas. Entenda-as. Inscreva-se em nossa newsletter. É grátis.

Compartilhe este artigo

Aviso Legal. As informações fornecidas não constituem aconselhamento de investimento. Cryptopolitan.com não assume responsabilidade por quaisquer investimentos realizados com base nas informações fornecidas nesta página. Recomendamos fortemente a realização de pesquisa independente e/ou consulta com um profissional qualificado antes de tomar quaisquer decisões de investimento.

John Palmer

John Palmer

John Murangiri chegou à Cryptopolitan com habilidades em análise de mercado. John (também conhecido como JP) formou-se na Universidade de Nairobi com bacharelado em comunicação social e estudos de mídia. Ele já contribuiu anteriormente com insights sobre o mercado de criptomoedas para InsideBitcoins.com e Metacoingraph.

MAIS … NOTÍCIAS