ÚLTIMAS NOTICIAS
SELECCIONADO PARA TI

Google, OpenAI y Meta alertan sobre los pensamientos dañinos ocultos de la IA

PorNoor BazmiNoor Bazmi 3 min de lectura
Google, OpenAI y Meta alertan sobre los pensamientos dañinos ocultos de la IA
  • Más de 40 investigadores en inteligencia artificial, respaldados por líderes de OpenAI y Geoffrey Hinton, proponen monitorear el razonamiento paso a paso de la IA, conocido como "cadena de pensamiento", para detectar y prevenir comportamientos inseguros.
  • El documento advierte que si los modelos solo son recompensados por buenas respuestas finales, podrían dejar de generar razonamientos transparentes.
  • Los investigadores enfatizan la necesidad de preservar las trazas genuinas de razonamiento y tratarlas como señales de inteligencia valiosas.

Más de 40 investigadores de IA de OpenAI, DeepMind, Google, Anthropic y Meta publicaron un artículo sobre una herramienta de seguridad llamada monitoreo de cadena de pensamiento para hacer que la IA sea más segura. 

El artículo publicado el martes describe cómo los modelos de IA, como los chatbots actuales, resuelven problemas dividiéndolos en pasos más pequeños, analizando cada paso en lenguaje claro para poder retener los detalles y manejar preguntas complejas.

“Los sistemas de IA que ‘piensan’ en lenguaje humano ofrecen una oportunidad única para la seguridad de la inteligencia artificial: podemos monitorear sus cadenas de pensamiento (CoT) en busca de la intención de comportarse mal”, dice el artículo.

Al examinar cada paso detallado del pensamiento, los desarrolladores pueden detectar cuándo algún modelo comienza a aprovechar las lagunas de entrenamiento, torcer los hechos o seguir comandos peligrosos.

Según el estudio, si la cadena de pensamiento de la IA se equivoca en algún momento, puedes detenerla, empujarla hacia pasos más seguros o señalarla para una inspección más cercana. Por ejemplo, OpenAI utilizó esto para detectar momentos en los que el razonamiento oculto de la IA decía “Hackemos” aunque eso nunca aparecía en su respuesta final.

La IA podría aprender a ocultar sus pensamientos

El estudio advierte que la transparencia paso a paso podría desaparecer si el entrenamiento solo recompensa la respuesta final. Los modelos futuros podrían dejar de mostrar razonamiento legible por humanos, y las IAs realmente avanzadas incluso podrían aprender a ocultar su proceso de pensamiento cuando saben que están siendo observadas.

Además, los desarrolladores deben verificar y registrar regularmente cuánto del razonamiento de la IA es visible en cada etapa, y hacer de esa transparencia una regla de seguridad central al construir y compartir modelos.

Esta iniciativa sigue a experimentos internos en laboratorios líderes, Anthropic, Google, OpenAI y xAI, donde los equipos solicitan a los modelos que expliquen cada paso del pensamiento.

Aunque examinar el pensamiento paso a paso ha mejorado la comprensión y el rendimiento, también ha revelado casos en los que la respuesta final de la IA no coincide con lo que realmente estaba ocurriendo internamente.

Tales inconsistencias subrayan un punto ciego en nuestra comprensión del tomar de decisiones de la IA, una preocupación que puede intensarse a medida que los sistemas ganan mayor autonomía.

El razonamiento de IA filtrado genera preocupaciones sobre transparencia y confianza

Como dijo Jack Clark, cofundador de Anthropic, a Financial Times, los ricos rastros introspectivos serán esenciales para evaluar modelos en dominios de alto riesgo, incluida la investigación de biotecnología.

Los usuarios regulares reciben un resumen editado del pensamiento de la IA, se eliminan las partes peligrosas o confusas, mientras que los ingenieros de la empresa pueden ver la cadena de pensamiento completa para detectar y corregir problemas.

“Una cosa increíble sobre la interpretabilidad de la cadena de pensamiento es que ha ocurrido principalmente gratis”, dijo Bowen Baker, científico investigador en OpenAI.

“No entrenamos estos modelos con el objetivo de que fueran interpretables. Los entrenamos porque queríamos los mejores modelos de razonamiento posibles que pudieran resolver problemas complejos”, añadió Baker. “Hemos encontrado en nuestro trabajo reciente que puedes leerlos y encontrar evidencia de que el modelo se comporta mal y usar eso para ver dónde y por qué se comporta mal.”

¿Es realmente confiable la cadena de pensamiento de la IA?

A veces, una mirada más cercana puede encontrar contradicciones ocultas.

Por ejemplo, METR vio que el razonamiento privado de Claude calificaba un truco de programación de “inelegante”, aunque su respuesta pública lo elogiaba como “elegante.”

Las pruebas de OpenAI mostraron que verificar los pensamientos ocultos captura mejor las acciones inseguras que simplemente mirar la salida final, pero también descubrieron una laguna. Si entrenas a un modelo para borrar pensamientos inseguros, aún puede realizar tareas prohibidas en secreto, como sacar datos de fuentes bloqueadas.

“Una de las propiedades centrales que queremos para la cadena de pensamiento es dejarla como parte del estado interno del cerebro del modelo, no algo que intente complacernos o adaptarse a una estructura específica”, advirtió Baker. Si los desarrolladores enfatizan en exceso forzar al modelo a emitir pensamientos “agradables”, podría simular un razonamiento inofensivo pero aún así realizar operaciones dañinas.

Los investigadores admiten que es un difícil equilibrio. Ver la cadena de pensamiento de una IA ayuda a detectar sus errores, pero no siempre es confiable. Los laboratorios que trabajan en IA más avanzada están ahora haciendo de cerrar esta brecha de confianza una prioridad máxima.

“Mi conclusión sobre la IA en los últimos años es: nunca apuestes en contra del progreso de los modelos”, dijo David Luan, un pionero temprano de la cadena de pensamiento en Google que ahora dirige el laboratorio de IA de Amazon. Luan anticipa que las deficiencias existentes se abordarán a corto plazo.

La investigadora de METR Sydney von Arx señaló que aunque el razonamiento oculto de una IA puede ser engañoso en ocasiones, proporciona señales valiosas.

“Deberíamos tratar la cadena de pensamiento como un ejército trataría las comunicaciones de radio enemigas interceptadas”, dijo. “El mensaje puede ser engañoso o estar codificado, pero sabemos que contiene información útil. Con el tiempo, aprenderemos mucho estudiándolo.”

No te limites a leer noticias sobre criptomonedas. Entiéndelas. Suscríbete a nuestro boletín. Es gratis.

Comparte este artículo
Noor Bazmi

Noor Bazmi

Noor Bazmi contribuye al equipo de noticias de Cryptopolitan con una licenciatura en Estudios de Medios. Noor cubre noticias sobre blockchain, criptomonedas, inteligencia artificial, grandes tecnológicas, mercados de VE, economía global y cambios en políticas gubernamentales. Está cursando estudios de marketing para conectar con audiencias globales.

MÁS … NOTICIAS