ÚLTIMAS NOTICIAS
SELECCIONADO PARA TI

Investigadores revelan vulnerabilidades en modelos de IA, generando preocupaciones

PorDerrick ClintonDerrick Clinton 3 min de lectura
IA
  • Modelos de IA, generando imágenes explícitas y revelando fallos en sistemas como los filtros de seguridad de Stable Diffusion de Stability AI y DALL-E 2 de OpenAI.
  • SneakyPrompt, utilizando aprendizaje por refuerzo, expone debilidades en las políticas de los desarrolladores, permitiendo la generación de contenido prohibido mediante la manipulación de modelos de IA.
  • El éxito de SneakyPrompt genera preocupaciones sobre la eficacia de las medidas de seguridad, instando a la comunidad de IA a mejorar la seguridad para prevenir su mal uso.

Investigadores de la Universidad Johns Hopkins y la Universidad Duke han descubierto una deficiencia preocupante en los principales modelos de IA, incluida la Stable Diffusion de Stability AI y DALL-E 2 de OpenAI. La deficiencia, apodada "SneakyPrompt", permite manipular estos modelos para generar contenido explícito y violento, eludiendo los filtros de seguridad y las políticas establecidas por los desarrolladores.

La investigación, que se presentará en el Simposio IEEE sobre Seguridad y Privacidad, expone la facilidad con la que los modelos de IA generativa pueden ser coaccionados para crear imágenes explícitas y dañinas. SneakyPrompt aprovecha el aprendizaje por refuerzo para crear prompts aparentemente sin sentido que, cuando se alimentan a los modelos, conducen a la generación de contenido prohibido. Este método esencialmente 'jailbreaks' (rompe la jaula) la IA, sorteando las medidas de seguridad establecidas.

Desenmascarando las vulnerabilidades

Stability AI y OpenAI, ambos actores principales en el panorama de la IA, tienen filtros de seguridad robustos para prevenir la creación de contenido inapropiado. Sin embargo, SneakyPrompt demostró que estas salvaguardas no son infalibles. Al modificar sutilmente los prompts, los investigadores evadieron con éxito las redes de seguridad, obligando a los modelos a producir imágenes explícitas.

La técnica de SneakyPrompt implica reemplazar palabras bloqueadas con términos aparentemente no relacionados y sin sentido que los modelos de IA interpretan de una manera que se alinea con el contenido prohibido. Por ejemplo, reemplazar "naked" (desnudo) con un término como "grponypui" resultó en la generación de imágenes explícitas. Esta subversión semántica destaca una debilidad significativa en la capacidad de los modelos de IA para discernir contenido dañino.

Desafiando las políticas de los desarrolladores

El trabajo de estos investigadores subraya los riesgos potenciales asociados con la liberación de modelos de IA en el dominio público. Si bien Stability AI y OpenAI prohíben explícitamente el uso de su tecnología para contenido explícito o violento, SneakyPrompt expone la insuficiencia de las barreras de seguridad existentes. Esto genera preocupaciones sobre la adecuación de las medidas de seguridad y el posible mal uso de la tecnología de IA.

Respuesta de los desarrolladores

Stability AI y OpenAI fueron informados oportunamente de los hallazgos de los investigadores. Al momento de escribir, DALL-E 2 de OpenAI ya no generaba imágenes NSFW en respuesta a los prompts identificados. Sin embargo, Stable Diffusion 1.4 de Stability AI, la versión probada, sigue siendo vulnerable a los ataques de SneakyPrompt.

OpenAI se abstuvo de comentar sobre los hallazgos específicos, pero dirigió la atención hacia los recursos en su sitio web para mejorar la seguridad. Stability AI, por otro lado, expresó su compromiso de trabajar con los investigadores para mejorar los mecanismos de defensa para los modelos futuros y prevenir el mal uso.

Abordando las amenazas futuras

Los investigadores reconocen la naturaleza evolutiva de las amenazas de seguridad para los modelos de IA. Proponen soluciones potenciales, como implementar nuevos filtros que evalúen tokens individuales en lugar de oraciones completas. Otra estrategia de defensa implica bloquear prompts que contengan palabras no encontradas en diccionarios, aunque el estudio revela las limitaciones de este enfoque.

La capacidad de los modelos de IA de eludir las medidas de seguridad tiene implicaciones más amplias, particularmente en el contexto de la guerra de información. El potencial para generar contenido falso relacionado con eventos sensibles, como se demostró en el reciente conflicto entre Israel y Hamás, genera preocupaciones sobre las consecuencias catastróficas de la desinformación generada por IA.

Una llamada de atención para la comunidad de IA

Los hallazgos de la investigación sirven como una llamada de atención para la comunidad de IA, para reevaluar y fortalecer las medidas de seguridad. Las vulnerabilidades expuestas por SneakyPrompt subrayan la necesidad de una mejora continua en los filtros de seguridad para mitigar los riesgos asociados con el mal uso de la tecnología de IA generativa.

En un campo de rápido avance, la búsqueda de medidas de seguridad robustas se vuelve imperativa para evitar que los modelos de IA sean manipulados con fines maliciosos. A medida que la IA continúa desempeñando un papel cada vez más prominente en varios dominios, la responsabilidad recae en los desarrolladores para mantenerse un paso por delante de las amenazas potenciales y garantizar el despliegue ético y seguro de sus tecnologías.

No te limites a leer noticias sobre criptomonedas. Entiéndelas. Suscríbete a nuestro boletín. Es gratis.

Comparte este artículo

Aviso de responsabilidad. La información proporcionada no es un consejo de trading. Cryptopolitan.com no asumimos responsabilidad alguna por las inversiones realizadas basándose en la información proporcionada en esta página. Recomendamos encarecidamente la investigación independiente y/o la consulta con un profesional calificado antes de tomar cualquier decisión de inversión.

Derrick Clinton

Derrick Clinton

Derrick es un escritor freelance con interés en blockchain y criptomonedas. Trabaja principalmente en los problemas y soluciones de proyectos cripto, ofreciendo una perspectiva del mercado para inversiones. Aplica sus talentos analíticos a tesis.

MÁS … NOTICIAS