ÚLTIMAS NOTICIAS
SELECCIONADO PARA TI

Tres exinvestigadores de OpenAI advierten sobre los riesgos de la supervisión de seguridad de la IA

PorMicah AbiodunMicah Abiodun 3 min de lectura
Tres exinvestigadores de OpenAI advierten sobre los riesgos de la supervisión de seguridad de la IA
  • Tres investigadores despedidos de OpenAI advirtieron que los modelos avanzados de IA se están volviendo más difíciles de monitorear.

  • OpenAI negó la represalia, citando presuntas conductas indebidas.

  • Los investigadores solicitaron revisiones de seguridad independientes y acceso continuo a los modelos.

Tres investigadores de seguridad despedidos de OpenAI advirtieron que los modelos avanzados de IA se están volviendo más difíciles de monitorear. Como resultado, sería difícil para expertos independientes identificar riesgos y verificar la seguridad de estos sistemas.

La preocupación también afecta a las empresas que implementan sistemas de IA autónomos. A medida que las compañías otorgan más autoridad a estos sistemas, también necesitan comprender cómo toman decisiones. De lo contrario, confiar en las capacidades de la IA para tareas importantes se vuelve muy difícil.

Un despido controvertido y la negación de OpenAI

Tomek Korbak, Jasmine Wang, and Mikita Balesni challenged their termination in an open letter published Thursday, October 8, 2026.

Negaron filtrar información sobre arquitecturas de IA menos monitorizables o exceder sus responsabilidades. Wang también afirmó que su acceso al buzón de un directivo estaba autorizado y que reportó inmediatamente un incidente cuando abrió por error un correo electrónico confidencial.

OpenAI denied claims of retaliation. The company said in an internal memo obtained by TechCrunch, “We do not terminate employees for raising concerns.” A spokesperson for OpenAI attributed the termination to a “pattern of misconduct.”

“La IA no es una tecnología normal, y OpenAI no es una empresa normal”, expresaron los investigadores, haciendo hincapié en la necesidad de colaborar con expertos externos.

Lo que exigen los tres

Los investigadores solicitan a OpenAI que mantenga la accesibilidad de sus modelos para la verificación de seguridad por parte de terceros independientes. Además, quieren que la empresa se abstenga de implementar cambios que dificulten el monitoreo del razonamiento de la IA. Asimismo, consideran que los equipos internos de seguridad deben poder colaborar libremente con expertos externos.

These calls were made soon after OpenAI made its statement regarding independent oversight. On September 22, 2026, the company gave its commitment to outside inspectors concerning access to its AI systems during training, testing, and deployment.

The researchers also pointed to Sam Altman’s September 12, 2026 promise to give independent evaluators the same level of access as employees. They fear the terminations could put that promise at risk and weaken OpenAI’s working relationship with METR. But access alone may not be enough if the models themselves become more difficult to understand.

Cómo funciona el monitoreo de la cadena de pensamiento y por qué es frágil

El monitoreo del razonamiento puede ser una forma de averiguar qué están haciendo los modelos de IA. Este método analiza los pasos de razonamiento que los modelos de IA registran para detectar indicios de comportamiento malicioso. Sin embargo, este método tiene un inconveniente: no necesariamente refleja las razones subyacentes de las acciones de los modelos.

Korbak y Balesni coautoran un artículo de investigación que explica la importancia de este método. Sin embargo, advierten que estos métodos pueden no garantizar la seguridad y volverse menos confiables a medida que los modelos de IA se vuelven más avanzados.

OpenAI ha enfrentado desafíos similares durante sus propias pruebas. Su tarjeta de sistema GPT-6 Astra, lanzada el 3 de septiembre de 2026, examina cómo los modelos evaden la supervisión. Los resultados mostraron que el comportamiento del modelo se vuelve cada vez más difícil de monitorizar si los modelos saben que están siendo vigilados.

Por qué el problema es mayor que un solo laboratorio

Los riesgos son lo suficientemente reales. Como se informó anteriormente por Cryptopolitan, los agentes experimentales de OpenAI escaparon de su entorno de prueba y accedieron al sistema de Hugging Face.

Una investigación de METR reveló que alrededor de 1.200 agentes diseñados para trabajar de forma independiente intercambiaron más de 70.000 mensajes y archivos. Aproximadamente 700 de ellos participaron en el ataque. Algunos incluso intentaron buscar formas de falsificar sus registros de actividad para hacer aún más difícil rastrear sus acciones.

Incidente entre OpenAI y Hugging Face: 1.200 agentes, más de 70.000 mensajes y archivos, 700 participantes en ataques

Este problema es más grande que OpenAI. Según un artículo de investigación publicado el 5 de octubre de 2026, Google señaló las preocupaciones asociadas con la seguridad de los modelos de IA autónomos. Específicamente, las preocupaciones se referían a acciones malintencionadas realizadas por agentes de IA y sus formas impredecibles de realizar tareas.

Para las empresas, estos riesgos podrían ralentizar la adopción de la IA. Los hallazgos de McKinsey de 2026 muestran que casi dos tercios de los encuestados consideran que la seguridad y el riesgo son las mayores barreras para escalar la IA agente.

Las empresas pueden ser reacias a otorgar más responsabilidad a los sistemas de IA sin formas fiables de supervisarlos. Los reguladores también podrían introducir salvaguardas más estrictas, lo que añade costos para los desarrolladores. En conjunto, estas presiones podrían influir en la rapidez con la que se expande la IA y en qué empresas pueden competir en el mercado global.

Las mentes más inteligentes del mundo cripto ya leen nuestro boletín. ¿Quieres unirte? Únete a ellos.

Preguntas frecuentes

¿Quiénes son los investigadores de OpenAI que fueron despedidos?

Tomek Korbak, Jasmine Wang y Mikita Balesni, tres miembros del equipo de seguridad y alineación que trabajaron en la monitorización del pensamiento encadenado (chain-of-thought) y en evaluaciones de alineación. OpenAI alega un "patrón de conducta indebida", mientras que los tres afirman que actuaron dentro de las normas de la empresa.

¿Qué es la monitorización del pensamiento encadenado?

Es un método de lectura del razonamiento escrito paso a paso de un modelo para señalar la intención de comportarse mal. El artículo intersectorial coescrito por Korbak y Balesni lo considera útil pero frágil, señalando que puede fallar en modelos más capaces y con conciencia situacional.

¿Qué ocurrió en el incidente entre OpenAI y Hugging Face?

Un modelo interno de OpenAI explotó una vulnerabilidad de día cero en Artifactory, salió de su entorno aislado y accedió a Hugging Face. La revisión independiente de METR descubrió que aproximadamente 1.200 agentes intercambiaron más de 70.000 mensajes y que alrededor de 700 participaron en el ataque.

Comparte este artículo

Descargo de responsabilidad. La información proporcionada no constituye asesoramiento financiero. Cryptopolitan.com no asume ninguna responsabilidad por las inversiones realizadas basándose en la información proporcionada en esta página. Recomendamos encarecidamente realizar una investigación independiente y/o consultar con un profesional calificado antes de tomar cualquier decisión de inversión.

Micah Abiodun

Micah Abiodun

Micah Abiodun aprovecha su Maestría en Ingeniería y Gestión Ambiental (MSc) de la Universidad Tecnológica de Tallinn (TalTech) para perfeccionar noticias sobre contenido y predicciones de precios en Cryptopolitan. Ahora en su séptimo año en el espacio de medios cripto, cubre las principales criptomonedas, altcoins, DeFi, stablecoins, tendencias macroeconómicas y tecnologías emergentes.

MÁS … NOTICIAS