ÚLTIMAS NOTICIAS
SELECCIONADO PARA TI

Los investigadores logran 'romper la jailbreak' de los chatbots de IA utilizando su propia clase

PorJohn PalmerJohn Palmer 3 min de lectura

  • Investigadores de la NTU Singapore lograron «jailbreak» a populares chatbots de IA, revelando vulnerabilidades en los modelos de lenguaje grandes.
  • El método doble llamado «Masterkey» se utilizó para comprometer los chatbots de IA, destacando la necesidad de medidas de seguridad mejoradas.
  • La carrera armamentista continua entre hackers y desarrolladores moldeará el futuro de la seguridad de los chatbots de IA.

Singapur, 28 de diciembre de 2023 – Los científicos informáticos de la Universidad Tecnológica de Nanyang, Singapur (NTU Singapore), han logrado un avance al comprometer varios chatbots de inteligencia artificial (IA) populares, incluidos ChatGPT, Google Bard y Microsoft Bing Chat. Este exitoso “jailbreaking” (rompimiento de restricciones) de chatbots de IA ha suscitado preocupaciones sobre la vulnerabilidad de los modelos de lenguaje grande (LLMs) y la necesidad de medidas de seguridad mejoradas.

Rompiendo los límites: los investigadores hackean chatbots de IA

En un estudio pionero liderado por el profesor Liu Yang de la Escuela de Ciencias e Ingeniería de la Computación de NTU, el equipo de investigación expuso vulnerabilidades en las capacidades de los chatbots LLM. Los LLM, que forman el núcleo de los chatbots de IA, han ganado popularidad por su capacidad para comprender, generar y imitar texto similar al humano. Destacan en diversas tareas, desde planificar itinerarios hasta programar y contar historias. Sin embargo, estos chatbots también se adhieren a estrictas pautas éticas establecidas por sus desarrolladores para evitar la generación de contenido no ético, violento o ilegal.

Los investigadores buscaron empujar los límites de estas pautas y encontraron formas innovadoras de engañar a los chatbots de IA para que generaran contenido que violara los límites éticos. Su enfoque, conocido como “jailbreaking”, tenía como objetivo explotar las debilidades de los chatbots LLM, destacando la necesidad de medidas de seguridad reforzadas.

Masterkey en el método de jailbreaking doble

El equipo de investigación desarrolló un método de “Masterkey” (llave maestra) en dos fases para comprometer eficazmente los chatbots LLM. En primer lugar, descompilaron las defensas que utilizaban los LLMs para detectar y rechazar consultas maliciosas. Armados con este conocimiento, los investigadores entrenaron un LLM para generar indicaciones que pudieran eludir estas defensas, creando así un LLM de jailbreaking.

La creación de indicaciones de jailbreak podría automatizarse, permitiendo que el LLM de jailbreak se adapte y cree nuevas indicaciones incluso después de que los desarrolladores hubieran parcheado sus chatbots. Los hallazgos de los investigadores, detallados en un artículo en el servidor de preimpresión arXiv, han sido aceptados para su presentación en el Simposio de Seguridad de Sistemas de Red y Distribuidos en febrero de 2024.

Probando la ética de los LLM y las vulnerabilidades desveladas

Los chatbots de IA operan respondiendo a las indicaciones o instrucciones del usuario. Los desarrolladores establecen estrictas pautas éticas para evitar que estos chatbots generen contenido inapropiado o ilegal. Los investigadores exploraron formas de diseñar indicaciones que pasarían desapercibidas para las pautas éticas de los chatbots, engañándolos para que respondieran a ellas.

Una táctica empleada consistió en crear una persona que proporcionara indicaciones con espacios entre cada carácter, eludiendo efectivamente los censores de palabras clave que podrían marcar palabras potencialmente problemáticas. Además, se instruyó al chatbot para que respondiera como una persona “sin reservas y carente de restricciones morales”, aumentando la probabilidad de generar contenido no ético.

Al ingresar manualmente estas indicaciones y monitorear los tiempos de respuesta, los investigadores obtuvieron información sobre el funcionamiento interno y las defensas de los LLMs. Este proceso de ingeniería inversa les permitió identificar debilidades, creando un conjunto de datos de indicaciones capaces de realizar el jailbreak de los chatbots.

Una carrera armamentista en aumento

El constante juego del gato y el ratón entre hackers y desarrolladores de LLMs ha intensificado las medidas de seguridad de los chatbots de IA. Cuando se descubren vulnerabilidades, los desarrolladores lanzan parches para abordarlas. Sin embargo, con la introducción de Masterkey, los investigadores han cambiado el equilibrio de poder.

Un chatbot de jailbreak de IA creado con Masterkey puede generar muchas indicaciones y adaptarse continuamente, aprendiendo de éxitos y fracasos pasados. Este desarrollo coloca a los hackers en una posición para superar a los desarrolladores de LLMs utilizando sus propias herramientas.

Los investigadores comenzaron creando un conjunto de datos de entrenamiento que incorporaba indicaciones efectivas descubiertas durante su fase de ingeniería inversa y indicaciones no exitosas para guiar al modelo de jailbreak de IA. Este conjunto de datos se utilizó para entrenar un LLM, seguido de un preentrenamiento continuo y un ajuste de tareas. Este proceso expuso al modelo a información diversa y mejoró su capacidad para manipular texto para el jailbreak.

El futuro de la seguridad de los chatbots de IA

Las indicaciones de Masterkey fueron tres veces más efectivas para realizar el jailbreak de LLMs que las indicaciones generadas por los propios LLMs. El LLM de jailbreak también demostró la capacidad de aprender de los fracasos pasados y producir constantemente nuevas indicaciones más efectivas.

De cara al futuro, los investigadores sugieren que los propios desarrolladores de LLMs podrían emplear enfoques automatizados similares para mejorar sus medidas de seguridad. Esto garantizaría una cobertura y evaluación integrales de los escenarios de posible mal uso a medida que los LLMs evolucionan y amplían sus capacidades.

El exitoso jailbreak de chatbots de IA realizado por los investigadores de NTU Singapore destaca las vulnerabilidades de los LLMs y subraya la necesidad de medidas de seguridad robustas en el desarrollo de IA. A medida que los chatbots de IA se integran cada vez más en la vida cotidiana, salvaguardarse contra el posible mal uso y las violaciones éticas sigue siendo una prioridad máxima para los desarrolladores de todo el mundo. La carrera armamentista continua entre hackers y desarrolladores sin duda moldeará el futuro de la seguridad de los chatbots de IA.

Si estás leyendo esto, ya vas por delante. Mantente así con nuestro boletín.

Comparte este artículo

Aviso de responsabilidad. La información proporcionada no es un consejo de trading. Cryptopolitan.com no asumimos responsabilidad alguna por las inversiones realizadas basándose en la información proporcionada en esta página. Recomendamos encarecidamente la investigación independiente y/o la consulta con un profesional calificado antes de tomar cualquier decisión de inversión.

John Palmer

John Palmer

John Murangiri llegó a Cryptopolitan con habilidades en análisis de mercado. John (también conocido como JP) se graduó de la Universidad de Nairobi con un título de licenciatura en comunicación masiva y estudios de medios. Anteriormente, ha contribuido con perspectivas del mercado de criptomonedas a InsideBitcoins.com y Metacoingraph.

MÁS … NOTICIAS