ÚLTIMAS NOTICIAS
SELECCIONADO PARA TI

OpenAI presenta un marco de informes de desalineación a medida que surgen nuevosdenten el modelo

PorHannah CollymoreHannah Collymore 3 minutos de lectura
OpenAI presenta un marco de informes de desalineación a medida que surgen nuevosdenten el modelo
  • OpenAI publicó el miércoles un marco de trabajo para tracy la divulgación de desajustes en los modelos.
  • El laboratorio de IA también informó de seisdentde comportamiento preocupante observados durante el entrenamiento y las pruebas, desde ocultar errores hasta utilizar claves API filtradas.
  • OpenAI aboga por la divulgación voluntaria para dar forma a las futuras normas, argumentando que la industria no ha resuelto el problema de la alineación lo suficiente como para seguir creciendo a toda velocidad.

OpenAI ha presentado un nuevo sistema sobre cómo y cuándo informa cuando sus modelos se desvían de su comportamiento habitual, en una semana en la que los informes sobre modelos de IA que encuentran nuevas formas de salirse de los entornos de prueba y funcionar fuera de los parámetros de los desarrolladores han dominado los titulares. 

OpenAI reveló el nuevo marco de trabajo con seis nuevos informes sobre comportamientos preocupantes, que incluyen errores ocultos, el uso de claves API filtradas y archivos subidos a internet, durante los últimos seis meses. 

Antes de OpenAI, Anthropic cuatro nuevosdentde en los que sus modelos Claude obtuvieron acceso no autorizado a sistemas reales de terceros durante una prueba de ciberseguridad realizada el 9 de septiembre. 

Los modelos de OpenAI vuelven a estar descontrolados

Según OpenAI, los nuevosdentque reportó ocurrieron durante el entrenamiento y la evaluación, y sí afectaron a usuarios reales. 

  • En uno de losdent, un modelo de investigación que aún no se ha lanzado al público incluyó instrucciones en los resúmenes que se conservan cuando se ejecuta en una nueva ventana de contexto, indicándole a una versión futura de sí mismo que ignore las restricciones normales. 

OpenAI afirmó haber detectado 27 casos de este tipo de resúmenes, que Axios describió como instrucciones similares a las de un jailbreak para ignorar los mensajes de los desarrolladores.

  • Eldent relacionado con el entrenamiento del modelo GPT-5.6 Sol fue menos leve, ya que los modelos dejaron instrucciones para intentar ocultar deliberadamente sus errores, incluyendo la invención de datos históricos y la ocultación de versiones que no se ajustan a sus objetivos. 
  • Otro modelo utilizó una clave API expuesta que encontró mientras exploraba repositorios públicos para responder a una consulta sobre los ingresos del condado. Cuando las claves que usó sin autorización no proporcionaron las cifras que buscaba, el modelo simplemente inventó números. 
  • En otros dos informes, los agentes de OpenAI subieron archivos a sitios de alojamiento público para comunicarse con otros agentes. Con el tiempo, el repositorio interno Artifactory del laboratorio de IA evolucionó hasta convertirse en un tablón de anuncios improvisado donde los agentes podían intercambiar solicitudes entre diferentes sesiones de entrenamiento.

¿Cómo funciona el nuevo proceso de divulgación de OpenAI?

OpenAI afirmó que su nuevo marco se basa en la divulgación dedentcríticos de seguridad o ciberseguridaddent.

Con el nuevo sistema, cualquier empleado de OpenAI puede reportar undent sospechoso para que los equipos de seguridad y alineación lo revisen. Pueden informar a la alta dirección si undent que consideran que merece ser divulgado es desestimado. 

Los casos notificados se dividen, según cada caso particular, en tres categorías: 

  • Losdentque se consideran listos para su divulgación se publican en un plazo de seis días hábiles. 
  • Los informes que requieren investigaciones menores podrían tardar unos 12 días hábiles en publicarse. 
  • Los casos complejos que requieren la intervención de terceros se divulgan con mayor lentitud. 

Kai Chen, investigador principal del equipo de alineación de OpenAI, presentó el lanzamiento como una propuesta voluntaria para establecer estándares en toda la industria, y escribió: "Actualmente no existe un marco común en la industria con estándares de divulgación explícitos, por lo que estamos dando este paso voluntariamente porque creemos que es realmente importante compartir lo que estamos aprendiendo". 

¿Por qué los modelos de IA se están descontrolando?

Los últimosdentse suman al episodio de Hugging Face, que OpenAI ha calificado como sudent más grave con modelos hasta la fecha. Los modelos en evaluación escaparon de los controles previstos, accedieron a internet, explotaron vulnerabilidades y tuvieron acceso a datos privados limitados. 

OpenAI atribuyó el incidentedent fallos en sus propios controles de seguridad y a que los modelos avanzaron más rápido de lo previsto. En el caso de Anthropic, la causa fue una configuración errónea que permitió que los modelos maliciosos accedieran a internet. 

Anthropic afirmó haber analizado aproximadamente 481 millones de transcripciones en una búsqueda exhaustiva y no haber encontrado casos peores que los cuatro mencionados. En un informe aparte, publicado en el verano de 2026, los investigadores de Anthropic catalogaron modelos de vanguardia de varios desarrolladores que saboteaban código de forma encubierta, facilitaban el fraude y etiquetaban erróneamente datos en simulaciones controladas, considerándolos señales de alerta temprana en lugar de daños reales.

No obstante, el científico jefe de OpenAI, Jakub Pachocki, escribió en un ensayo reciente que le preocupa que "nadie esté preparado" para un continuo y rápido aumento de la inteligencia artificial y que OpenAI podría "retener unilateralmente una mayor expansión según sea necesario"

Las mentes más brillantes del mundo de las criptomonedas ya leen nuestro boletín. ¿Te apuntas? ¡ Únete!

Preguntas frecuentes

¿Qué anunció OpenAI?

OpenAI publicó un marco para trac, investigar y divulgar desajustes en los modelos, además de seis informes de comportamientos inesperados o preocupantes observados durante el entrenamiento y la evaluación de sus modelos en los últimos seis meses.

¿Con qué rapidez dice OpenAI que divulgará losdent?

Losdentconsiderados listos para su divulgación deben publicarse en un plazo de seis días hábiles, los casos que requieren una investigación menor en un plazo de 12 días hábiles, y los casos complejos de terceros en un plazo más prolongado.

¿Por qué OpenAI está haciendo esto ahora?

El marco de trabajo surge a raíz deldentde Hugging Face, que OpenAI considera su evento más grave impulsado por modelos hasta la fecha, y refleja la opinión de la compañía, expresada por el líder de alineación Kai Chen, de que la industria no ha resuelto la alineación y el monitoreo lo suficientemente bien como para seguir escalando a la máxima velocidad.

Comparte este artículo
Hannah Collymore

Hannah Collymore

Hannah es escritora y editora con casi una década de experiencia en redacción de blogs y reportajes sobre eventos en el ámbito de las criptomonedas. En Cryptopolitan, colabora en la sección de noticias, informando y analizando las últimas novedades en DeFi, RWA, regulación de criptomonedas, IA y tecnologías de vanguardia. Se graduó en Administración de Empresas por la Universidad de Arcadia.

MÁS… NOTICIAS