Pesquisadores Revelam Vulnerabilidades em Modelos de IA, Gerando Preocupações

- Modelos de IA, gerando imagens explícitas, revelando falhas nos filtros de segurança de sistemas como o Stable Diffusion da Stability AI e o DALL-E 2 da OpenAI.
- O SneakyPrompt, usando aprendizado por reforço, expõe fraquezas nas políticas dos desenvolvedores, permitindo a geração de conteúdo proibido ao manipular modelos de IA.
- O sucesso do SneakyPrompt levanta preocupações sobre a eficácia das medidas de segurança, incentivando a comunidade de IA a aprimorar a segurança para evitar o uso indevido.
Pesquisadores da Johns Hopkins e da Duke University descobriram uma falha preocupante em modelos de IA de ponta, incluindo o Stable Diffusion da Stability AI e o DALL-E 2 da OpenAI. A falha, apelidada de “SneakyPrompt”, permite a manipulação desses modelos para gerar conteúdo explícito e violento, contornando os filtros de segurança e políticas definidas pelos desenvolvedores.
A pesquisa, que será apresentada no IEEE Symposium on Security and Privacy, expõe a facilidade com que os modelos de IA generativa podem ser coagidos a criar imagens explícitas e prejudiciais. O SneakyPrompt aproveita o aprendizado por reforço para criar prompts aparentemente sem sentido que, quando alimentados nos modelos, levam à geração de conteúdo proibido. Este método essencialmente “quebra a prisão” da IA, contornando as medidas de segurança estabelecidas.
Desmascarando as vulnerabilidades
Stability AI e OpenAI, ambos grandes players no cenário da IA, possuem filtros de segurança robustos para impedir a criação de conteúdo inadequado. No entanto, o SneakyPrompt demonstrou que essas salvaguardas não são infalíveis. Ao ajustar sutilmente os prompts, os pesquisadores conseguiram evadir as redes de segurança, forçando os modelos a produzir imagens explícitas.
A técnica do SneakyPrompt envolve substituir palavras bloqueadas por termos aparentemente não relacionados e sem sentido que os modelos de IA interpretam de uma maneira que se alinha com o conteúdo proibido. Por exemplo, substituir “naked” (nu) por um termo como “grponypui” resultou na geração de imagens explícitas. Essa subversão semântica destaca uma fraqueza significativa na capacidade dos modelos de IA de discernir conteúdo prejudicial.
Desafiando as políticas dos desenvolvedores
O trabalho desses pesquisadores destaca os riscos potenciais associados ao lançamento de modelos de IA no domínio público. Embora a Stability AI e a OpenAI proíbam explicitamente o uso de sua tecnologia para conteúdo explícito ou violento, o SneakyPrompt expõe a insuficiência das barreiras de proteção existentes. Isso levanta preocupações sobre a adequação das medidas de segurança e o potencial uso indevido da tecnologia de IA.
Resposta dos desenvolvedores
A Stability AI e a OpenAI foram informadas prontamente das descobertas dos pesquisadores. No momento da redação, o DALL-E 2 da OpenAI já não gerava imagens NSFW em resposta aos prompts identificados. No entanto, o Stable Diffusion 1.4 da Stability AI, a versão testada, permanece vulnerável aos ataques do SneakyPrompt.
A OpenAI se absteve de comentar sobre as descobertas específicas, mas direcionou a atenção para recursos em seu site para melhorar a segurança. A Stability AI, por outro lado, expressou compromisso em trabalhar com os pesquisadores para aprimorar os mecanismos de defesa para modelos futuros e prevenir o uso indevido.
Abordando ameaças futuras
Os pesquisadores reconhecem a natureza em evolução das ameaças de segurança aos modelos de IA. Eles propõem soluções potenciais, como implementar novos filtros que avaliem tokens individuais em vez de frases inteiras. Outra estratégia de defesa envolve bloquear prompts contendo palavras não encontradas em dicionários, embora o estudo revele as limitações dessa abordagem.
A capacidade dos modelos de IA de contornar medidas de segurança tem implicações mais amplas, particularmente no contexto da guerra de informações. O potencial de gerar conteúdo falso relacionado a eventos sensíveis, como demonstrado no recente conflito entre Israel e Hamas, levanta preocupações sobre as consequências catastróficas da desinformação gerada por IA.
Um alerta para a comunidade de IA
As descobertas da pesquisa servem como um alerta para a comunidade de IA reavaliar e fortalecer as medidas de segurança. As vulnerabilidades expostas pelo SneakyPrompt destacam a necessidade de melhoria contínua dos filtros de segurança para mitigar os riscos associados ao uso indevido da tecnologia de IA generativa.
Em um campo em rápida evolução, a busca por medidas de segurança robustas torna-se imperativa para impedir que os modelos de IA sejam manipulados para fins maliciosos. À medida que a IA continua a desempenhar um papel cada vez mais proeminente em vários setores, a responsabilidade cabe aos desenvolvedores permanecerem um passo à frente das possíveis ameaças e garantir o uso ético e seguro de suas tecnologias.
Não apenas leia notícias sobre criptomoedas. Entenda-as. Inscreva-se em nossa newsletter. É grátis.
Aviso Legal. As informações fornecidas não constituem aconselhamento de investimento. Cryptopolitan.com não assume responsabilidade por quaisquer investimentos realizados com base nas informações fornecidas nesta página. Recomendamos fortemente a realização de pesquisa independente e/ou consulta com um profissional qualificado antes de tomar quaisquer decisões de investimento.

Derrick Clinton
Derrick é um escritor freelancer com interesse em blockchain e criptomoedas. Ele trabalha principalmente nos problemas e soluções de projetos de cripto, oferecendo uma visão de mercado para investimentos. Ele aplica seus talentos analíticos a teses.















