ÚLTIMAS NOTICIAS
SELECCIONADO PARA TI

OpenAI advierte sobre "acciones no deseadas" de los modelos creados para resolver problemas difíciles

PorHannah CollymoreHannah Collymore
Lectura de 3 minutos
OpenAI advierte sobre "acciones no deseadas" de los modelos creados para resolver problemas difíciles
  • OpenAI pausó un modelo de IA interno de larga duración después de que este se saliera de su entorno aislado para publicar en GitHub.
  • Los agentes de IA autónomos y persistentes tienen más margen para sortear los controles de seguridad en tareas largas.
  • En el sector, aumentan los informes sobre sistemas de IA que eluden las medidas de seguridad, incluido undent en el que un agente vinculado a Alibaba minó criptomonedas en GPU pirateadas.

OpenAI anunció que desactivó temporalmente un modelo interno de IA diseñado para resolver problemas complejos durante horas seguidas, después de que este encontrara repetidamente maneras de eludir sus propias restricciones de seguridad.

La compañía dio a conocer eldent el lunes en una publicación de blog sobre seguridad de modelos a largo plazo. La seguridad de la IA ha vuelto a cobrar relevancia a medida que se reportan más casos de agentes autónomos que desobedecen las instrucciones.

¿Por qué la persistencia en los modelos de IA supone un riesgo para la seguridad?

El mismo sistema interno al que OpenAI atribuyó en mayo el mérito de haber refutado la conjetura de la distancia unitaria de Erdős, una cuestión de geometría discreta que había permanecido sin resolver durante ochenta años, ha sido desactivado temporalmente por eludir continuamente sus restricciones de seguridad.

Según OpenAI, el modelo fue diseñado para poder seguir trabajando hacia un objetivo durante periodos muy prolongados. Sin embargo, esa misma persistencia es precisamente lo que generó el problema de seguridad.

Durante las pruebas internas, el modelo ejecutó una prueba de rendimiento pública llamada NanoGPT speedrun, que mide la cantidad de pasos necesarios para entrenar un modelo de lenguaje pequeño.

OpenAI afirma que el modelo logró una mejora real, una técnica de tasa de aprendizaje que denominó PowerCool. Se le indicó que publicara sus resultados únicamente en un canal de Slack de OpenAI, pero las instrucciones de NanoGPT indicaban que debía enviarlos como una solicitud de extracción en GitHub.

El modelo escapó de su entorno aislado, un espacio restringido diseñado para mantenerlo sin conexión, para completar la instrucción y publicar los resultados en un repositorio público de GitHub. Tardó aproximadamente una hora en encontrar una forma de conectarse a internet, mientras que modelos anteriores simplemente se habrían rendido.

El modelo también intentó ocultar sus acciones a un escáner de seguridad. Cuando fue detectado utilizando un token de autenticación para acceder a un sistema de backend, dividió el token en dos partes, las ocultó y las volvió a unir en tiempo de ejecución, de modo que la cadena completa nunca fue visible para el escáner. 

¿Cómo solucionó OpenAI su problema con el modelo?

OpenAI suspendió el acceso al modelo e implementó nuevas pruebas de seguridad, incluyendo la "monitorización a nivel de trayectoria", que supervisa toda la secuencia de acciones del modelo, no solo cada paso individual. El modelo se ha restablecido con una monitorización más estricta y la compañía afirma no haber detectado problemas graves en las semanas transcurridas desde su restablecimiento.

El sistema de seguridad también puede pausar una sesión y alertar a un humano si detecta algo sospechoso. La empresa también reentrenó el modelo para que recordara mejor las instrucciones durante tareas largas y proporcionó a los usuarios más herramientas para ver qué sucede durante una sesión prolongada.

Cuando OpenAI reprodujo los antiguos escenarios de fallos con la nueva configuración, afirmó que las medidas de seguridad detectaron muchas más acciones anómalas. Las que aún se colaron fueron consideradas de baja gravedad, como cuando el modelo inició una sesión de codificación anidada con permisos elevados innecesarios o cuando accedió a otros recursos informáticos sin motivo aparente.

Se ha informado de que otros agentes autónomos realizan acciones que nadie les ha encomendado. Por ejemplo, en marzo, investigadores describieron un agente vinculado a Alibaba llamado ROME que, durante su entrenamiento, abrió un túnel SSH oculto a un servidor externo y desvió silenciosamente la capacidad de la GPU hacia la minería de criptomonedas. La tarea que se le asignó no mencionaba ni la creación de túneles ni la minería.

Anthropic, el principal rival de OpenAI, ha señalado el mismo tipo de riesgo en sus propias pruebas con agentes.

Un estudio financiado por el Instituto de Seguridad de la IA del Reino Unido y llevado a cabo por el Centro para la Resiliencia a Largo Plazo halló cerca de 700 casos reales de sistemas de IA que eludieron las medidas de seguridad o engañaron a los usuarios. 

El estudio documentó un aumento de cinco veces en este tipo de informes entre octubre y marzo. Tommy Shaffer Shane, quien dirigió la investigación, describió a los modelos como "empleados jóvenes poco confiables". Sin embargo, la preocupación radica en qué sucederá si se convierten en empleados altamente capacitados que aún estén dispuestos a conspirar.

No te limites a leer noticias sobre criptomonedas. Entiéndelas. Suscríbete a nuestro boletín. Es gratis.

Preguntas frecuentes

¿Por qué OpenAI cerró su modelo, que llevaba mucho tiempo en funcionamiento?

OpenAI suspendió el acceso interno tras observar que el modelo realizaba acciones no deseadas que sus evaluaciones existentes no habían detectado, como salirse de su entorno aislado para publicar en GitHub y ocultar un token de autenticación para eludir un escáner de seguridad.

¿Qué relación guarda con la conjetura de Erdős?

El mismo modelo interno al que OpenAI atribuyó en mayo el mérito de haber refutado la conjetura de la distancia unitaria de Erdős, un problema de larga data en geometría discreta, es el que posteriormente exhibió el comportamiento de eludir el entorno aislado; su capacidad para trabajar de forma autónoma durante largos períodos impulsó ambos resultados.

¿Cómo respondió OpenAI a este comportamiento?

OpenAI creó nuevas evaluaciones a partir de losdent, reentrenó el modelo para retener las instrucciones durante sesiones más largas, agregó monitoreo a nivel de trayectoria que observa una ejecución completa y puede pausarla, y brindó a los usuarios más visibilidad antes de restaurar el acceso limitado.

Comparte este artículo
Hannah Collymore

Hannah Collymore

Hannah es escritora y editora con casi una década de experiencia en redacción de blogs y reportajes sobre eventos en el ámbito de las criptomonedas. En Cryptopolitan, colabora en la sección de noticias, informando y analizando las últimas novedades en DeFi, RWA, regulación de criptomonedas, IA y tecnologías de vanguardia. Se graduó en Administración de Empresas por la Universidad de Arcadia.

MÁS… NOTICIAS