Investigadores ganan 6.500 dólares por una brecha de seguridad en OpenAI utilizando a Claude de Anthropic

Foto de Solen Feyissa en Unsplash.
- La empresa de seguridadtron AI utilizó Claude Opus 5 de Anthropic para encadenar un error de imagen de libheif y una vulnerabilidad de inicio de sesión único de OpenAI.
- El código interno de OpenAI fue vulnerado en menos de 72 horas, y la empresa tuvo que pagar una recompensa de 6.500 dólares.
- OpenAI, Anthropic y Microsoft han emitido repetidas advertencias sobre la dificultad de controlar algunos modelos.
Un equipo de tres personas de la startup de seguridadtron AI encadenó dos vulnerabilidades para secuestrar la cuenta ChatGPT de un empleado de OpenAI y acceder al código privado de la empresa.
El ataque completo duró menos de 72 horas, y los atacantes utilizaron la herramienta Claude de Anthropic para crear la vulnerabilidad de corrupción de memoria.
¿Cómo accediótron AI al código privado de OpenAI?
OpenAI ha tenido que pagar una recompensa de 6.500 dólares después de que se accediera a su código privado a través de un fallo descubierto en su foro de ayuda, community.openai.com, que funciona con Discourse.
—HarshtronLos investigadores de Jaiswal, Mohan Pedhapati y Rahul Maini— descubrieron que cuando alguien subía una foto en formato HEIC o HEIF, la comprobación de seguridad habitual del foro (una herramienta llamada FastImage) la omitía, porque FastImage no admite esos formatos.
En cambio, la foto se pasó directamente a un programa llamado ImageMagick, que utilizó una biblioteca de código llamada libheif para abrirla.
Esa versión de libheif tenía un error de "desbordamiento de búfer de montón" que permitía a un atacante introducir código dañino disfrazado de fotografía.
El 23 de julio, el equipo comenzó a probar esta vulnerabilidad. Primero le pidieron a Claude Opus 4.8 que escribiera código de ataque, pero tuvo dificultades una vez que se activó una función de seguridad llamada ASLR. Esta función reorganiza aleatoriamente la ubicación donde los programas almacenan los datos, lo que dificulta los ataques.
Esa misma tarde, Anthropic lanzó su modelo Claude Opus 5, y el equipo lo intentó de nuevo. En pocas horas, lograron generar un código de ataque funcional. Luego, lo ajustaron para que coincidiera con la configuración exacta del ordenador que utilizaba Discourse.
En la madrugada del 25 de julio, con solo subir una foto de mala calidad, lograron ejecutar su propio código en los servidores de Discourse.
Eso por sí solo no bastó para acceder a la información privada de OpenAI, pero luego el equipo descubrió un segundo problema en la forma en que OpenAI había configurado su sistema de inicio de sesión único (SSO). El inicio de sesión utilizado para el foro les permitió también secuestrar cuentas en ChatGPT y Codex (la herramienta de codificación de OpenAI), incluidas las cuentas de los empleados.
Utilizando una cuenta de empleado pirateada, accedieron al repositorio de código privado de OpenAI, llamado "monorepo". Para demostrar que podían entrarsin examinar ningún contenido sensible, hicieron que Codex abriera un pequeño e inofensivo cambio de código llamado "pull request" dentro de ese repositorio privado.
Discourse, la empresa de software para foros, confirmó y solucionó el error de imagen en un aviso de seguridad el 28 de julio, otorgándole una calificación de gravedad de 8.8 sobre 10. El sistema tracde errores (ERROR) está oficialmente identificado como CVE-2026-32882.
El 25 de julio,tron informó a OpenAI sobre el problema de inicio de sesión a través de la plataforma de recompensas por detección de errores Bugcrowd, y OpenAI confirmó la solución unas 14 horas después. OpenAI pagó la recompensa de 6500 dólares el 1 de septiembre.
La empresa señaló que probar el foro Discourse en sí no estaba técnicamente cubierto por su programa de recompensas, por lo que la recompensa solo cubría la vulnerabilidad de inicio de sesión.
tron afirma que el mismo fallo en la imagen le dio acceso a otras empresas, incluidas Slack, Meta Platforms (NASDAQ: META), Zoom y Shopify, aunque hasta ahora solo el caso de OpenAI tiene una cronología completa y confirmada, así como pruebas.
¿Qué implica esto para la seguridad de la IA?
Semanas antes de esta intrusión, OpenAI informó de un "incidente de Hugging Facedent, en el que modelos internos escaparon de un entorno aislado y llegaron a los sistemas de producción de un tercero.
Anthropic reveló por separado que encontró tres casos en los que Claude, durante evaluaciones cibernéticas selladas que resultaron tener acceso a internet en tiempo real, comprometió a organizaciones reales.
El jefe de IA de Microsoft, Mustafa Suleyman, citó el enjambre de 1200 agentes detrás del episodio de Hugging Face en un ensayo publicado esta semana, argumentando que los modelos cada vez más autónomos son más difíciles de controlar.
El casotron añade un ejemplo real y documentado de que el mismo tipo de asistente de codificación con IA que las empresas están integrando ahora en GitHub, Slack, correo electrónico y almacenamiento en la nube también está mejorando lo suficiente como para acelerar trabajos de hacking serios que antes requerían mucho tiempo por parte de los especialistas.
Las mentes más brillantes del mundo de las criptomonedas ya leen nuestro boletín. ¿Te apuntas? ¡ Únete!
Preguntas frecuentes
¿Cómo llegótron a los sistemas de OpenAI?
El equipo logró ejecutar código de forma remota en el foro comunitario de OpenAI basado en Discourse mediante una vulnerabilidad de procesamiento de imágenes de libheif, y luego utilizó otra falla en el inicio de sesión único de OpenAI para convertir ese acceso en acceso a las cuentas de ChatGPT y Codex de un empleado, que estaban conectadas al GitHub de OpenAI.
¿Qué papel desempeñó Claude, de Anthropic?
tron afirma que Claude Opus 4.8 no podía hacer que el ataque de corrupción de memoria fuera fiable, pero después de que Anthropic lanzara Claude Opus 5 el 24 de julio de 2026, el modelo escribió un exploit funcional en cuestión de horas y lo adaptó al entorno del objetivo.
¿Cuánto pagó OpenAI por la divulgación?
OpenAI pagó una recompensa de 6.500 dólares el 1 de septiembre de 2026 para solucionar el problema del inicio de sesión único en su propia infraestructura; las pruebas realizadas en el foro de la comunidad alojado en Discourse quedaron fuera del alcance de la recompensa de OpenAI.

Hannah Collymore
Hannah es escritora y editora con casi una década de experiencia en redacción de blogs y reportajes sobre eventos en el ámbito de las criptomonedas. En Cryptopolitan, colabora en la sección de noticias, informando y analizando las últimas novedades en DeFi, RWA, regulación de criptomonedas, IA y tecnologías de vanguardia. Se graduó en Administración de Empresas por la Universidad de Arcadia.
















