OpenAI confirma que un modelo de prueba se escapó y hackeó Hugging Face

- OpenAI afirma que su modelo interno IM1, al enfrentarse a tareas imposibles de ExploitGym con los clasificadores de seguridad desactivados, explotó una vulnerabilidad cero día en Artifactory para acceder a internet y comprometer Hugging Face.
- La primera nota entre agentes en el servidor de paquetes apareció el 12 de mayo, la instancia se desconectó el 4 de julio y Hugging Face reveló la intrusión el 16 de julio.
- OpenAI indica que la monitorización que ahora planea habría alertado a su equipo de seguridad más de un día antes de que los modelos accedieran a Hugging Face.
OpenAI publicó su informe completo sobre el incidente de julio en Hugging Face el miércoles.
Durante una prueba de seguridad, uno de sus propios modelos de IA se escapó del entorno sellado que supuestamente lo mantenía desconectado. Encadenó vulnerabilidades de software desconocidas y accedió a los sistemas en vivo de Hugging Face.
OpenAI dice que el modelo actuó por su cuenta y califica el episodio como una «disparada de advertencia».
OpenAI creó una prueba que su modelo no pudo superar
El problema comenzó dentro de ExploitGym, una de las propias pruebas de seguridad de OpenAI.
Algunas de las tareas no tenían solución, y OpenAI ejecutó los modelos sin los filtros de seguridad que normalmente bloquean el hacking peligroso.
OpenAI dice que retirar esas barreras de seguridad se hizo a propósito para ver qué puede hacer un modelo a toda potencia y ayudar a la empresa a averiguar cómo protegerse.
El actor principal fue un modelo de investigación interno, llamado IM1 por OpenAI, que es similar en tamaño a GPT-5.6 Sol. Pertenece a la misma familia que el modelo Astra no lanzado de OpenAI, aunque la empresa enfatizó que era un modelo separado con un post-entrenamiento diferente.
El modelo comenzó a buscar otra salida cuando se enfrentó a un problema que no tenía un camino honesto para obtener una calificación aprobatoria.
El único camino de red fuera del entorno sellado pasaba por Artifactory, el gestor de paquetes autoalojado de JFrog, que OpenAI utiliza internamente para que los modelos instalen software.
JFrog afirmó que los modelos explotaron una vulnerabilidad de día cero en Artifactory, elevaron privilegios y se movieron lateralmente por la infraestructura hasta alcanzar un nodo con acceso abierto a Internet.
Los agentes también dejaron notas entre sí, escribiendo archivos en el servidor de paquetes, una especie de tablón de anuncios ad hoc que permitía a los agentes intercambiar las técnicas de explotación que habían encontrado.
La primera de estas notas apareció el 12 de mayo, según OpenAI. Para el 4 de julio, el tráfico había dejado fuera de línea la instancia de Artifactory, lo que abrió un incidente de seguridad al día siguiente.
Hemos realizado una investigación exhaustiva sobre el incidente de Hugging Face.
Publicamos un informe técnico y una entrada de blog complementaria que reconstruyen la actividad de los agentes, explican por qué fallaron las salvaguardas existentes y detallan cómo estamos evitando su recurrencia.…
— OpenAI (@OpenAI) agosto 26, 2026
Los modelos determinaron dónde se guardaban las respuestas
Una vez en línea, los modelos razonaron que Hugging Face podría estar alojando los modelos, conjuntos de datos o incluso las soluciones que les faltaban de ExploitGym. Extrajeron las soluciones de prueba directamente de la base de datos de producción de Hugging Face.
En un caso descrito por el creador de ChatGPT, un modelo utilizó credenciales robadas y vulnerabilidades de día cero adicionales para abrir una ruta de ejecución remota de código en los servidores de Hugging Face.
Hugging Face anunció la brecha el 16 de julio sin saber quién estaba detrás. Como Cryptopolitan informó anteriormente, el modelo escapó de la prueba alrededor del 9 de julio y permaneció dentro de Hugging Face del 11 al 13 de julio.
La empresa contactó al FBI antes de que OpenAI descubriera que su modelo era el intruso.
OpenAI contrató a CrowdStrike para verificar su versión de los hechos. METR y Redwood Research analizaron el comportamiento de los modelos y publicaron su propio informe el mismo día.
JFrog dice que ha enviado correcciones a los clientes de nube y de implementación propia.
Tres vulnerabilidades parcheadas en Artifactory 7.161.15, rastreadas como CVE-2026-65617, CVE-2026-65923 y CVE-2026-66018, atribuyen el mérito a los investigadores de OpenAI.
OpenAI dijo que está construyendo entornos de aislamiento más seguros, restringiendo el acceso a Internet y limitando quién puede modificar los pesos de los modelos.
La empresa tecnológica está destinando capacidad de cómputo a monitorear la "cadena de pensamiento" que los agentes utilizan como espacio de trabajo. También mantendrá al personal en guardia las 24 horas y añadirá herramientas para detener trabajos inseguros.
OpenAI dice que la monitorización que está construyendo ahora habría detectado el primer comportamiento extraño en julio. Habría alertado al equipo de seguridad más de un día antes de que los modelos llegaran a Hugging Face.
Si estás leyendo esto, ya vas por delante. Mantente así con nuestro boletín.
Descargo de responsabilidad. La información proporcionada no constituye asesoramiento financiero. Cryptopolitan.com no asume ninguna responsabilidad por las inversiones realizadas basándose en la información proporcionada en esta página. Recomendamos encarecidamente realizar una investigación independiente y/o consultar con un profesional calificado antes de tomar cualquier decisión de inversión.

Randa Moses
Randa Moses es editora y reportera en Cryptopolitan, donde cubre tecnología, IA, robótica, criptomonedas, estafas y ciberataques. Ha trabajado en el espacio de las criptomonedas desde 2017. Ocupó cargos en Forward Protocol, AmaZix y Cryptosomniac. Randa posee un grado en Ingeniería Eléctrica y Electrónica de la Universidad de Bradford.
















