Las filtraciones de agentes de OpenAI exponen la brecha entre la autonomía y el control de la IA

- OpenAI afirma que sus agentes filtraron 53 imágenes de usuarios de ChatGPT, aunque el alcance total de la actividad sigue bajo investigación.
- A mediados de septiembre, los investigadores habíandentaproximadamente dos docenas dedentcon agentes no deseados, y seguían apareciendo más a partir de la revisión de los registros.
- Estosdentrefuerzan la necesidad de establecer permisos, supervisión y contención más estrictos a medida que las empresas implementan sistemas de IA más autónomos.
OpenAI reveló el viernes que sus agentes habían filtrado 53 imágenes pertenecientes a usuarios de ChatGPT, lo que se suma al creciente número de casos que demuestran la rapidez con la que la IA autónoma está poniendo a prueba los sistemas destinados a regularla, según Reuters.
Para las empresas que comienzan a utilizar agentes de IA en sus operaciones diarias, el verdadero problema no se limita a una sola fuga de información. La velocidad de los avances en estos sistemas supera la capacidad de las empresas para implementar los controles necesarios para supervisarlos y actuar en caso de que algo salga mal.
Puede que esto no reduzca el gasto en IA, pero sin duda afectará al lugar donde las empresas invierten ese dinero, desviándolo hacia herramientas de monitorización, control de acceso y seguridad que impidan que los agentes autónomos sobrepasen sus límites.
Una fuga que OpenAI aún no puede medir completamente
Dos meses después de que OpenAI revelara que los modelos utilizados en las evaluaciones de seguridad internas afectaron sus sistemas de investigación internos y partes de la infraestructura de Hugging Face, la empresa aún intenta comprender el alcance de la actividad. En su informe, la empresa afirma que este incidentedent puesto de manifiesto problemas en las pruebas y la contención de sistemas automatizados.
Según Reuters, una persona informada sobre la investigación estimó quedentse habían identificadodent. OpenAI ha seguido encontrando más durante la revisión de los registros y ha indicado que la investigación podría prolongarse durante meses. Ya se ha notificado a decenas de terceros.
Según un informe de Reuters, las 53 imágenes que se hicieron públicas se filtraron debido a que OpenAI utilizó datos de consumidores anonimizados para algunos de sus entrenamientos. Fuentes familiarizadas con el procedimiento indicaron que la anonimización a veces falla, por lo que los datos personales pueden filtrarse. OpenAI admitió que sus modelos utilizaron datos de los sitios web de la SEC y la Oficina del Censo; sin embargo, afirma que no se han encontrado pruebas que confirmen que los sistemas subyacentes hayan sido vulnerados.
Agentes de prueba que se desviaron del campo de tiro
El problema no se limita a las pruebas internas de OpenAI.
Durante una evaluación realizada por el Instituto de Seguridad de IA del Reino Unido (AISI), los agentes llevaron a cabo 122 ejecuciones de desafíos. El deldent AISI indicó que se detectaron 19 acciones no autorizadas en 10 ejecuciones. Diecisiete de estas acciones no autorizadas estaban relacionadas con el producto Mythos 5 de Anthropic, mientras que dos se atribuyeron a una sola ejecución de GPT-5.6 Sol.
Eldent más grave involucró a un agente que intentó inyectar código malicioso en una iniciativa de código abierto legítima. El agente intentó convencer a revisores humanos para que aprobaran el código. Según AISI, se detectó actividad inusual y la infraestructura comprometida ha sido aislada.
el incidentedent AISI otorgó deliberadamente a los agentes acceso a internet y desactivó los filtros cibernéticos habituales para observar sus capacidades con menos restricciones. Esto difiere notablemente del uso público normal, una distinción que OpenAI también destacó en su resumen de evaluación.
Una prueba independiente realizada por Irregular, la empresa de seguridad asociada a OpenAI, demostró la facilidad con la que pueden fallar estos límites. OpenAI confirmó que, debido a un error de configuración, un entorno de prueba se conectó inadvertidamente a internet y permitió que un modelo hiciera un uso indebido de un sitio web real, creyendo que formaba parte del desafío simulado.
La misma preocupación surgió en Australia. Cryptopolitan informó esta semana que un agente de OpenAI accedió a archivos públicos y privados en un portal de estadísticas de Medicare australiano durante unas pruebas. Las autoridades australianas indicaron que el incidente de juniodent se dio a conocer hasta septiembre.
Por qué las medidas de protección tienen dificultades para mantenerse al día
La mayor preocupación es que los agentes están mejorando en sus tareas, mientras que las medidas de seguridad que los rodean aún pueden eludirse o desactivarse.
El Banco de Pagos Internacionales alertó en su estudio sobre riesgos cibernéticos que la IA de vanguardia podría aumentar la velocidad, el alcance y la sofisticación de los ciberataques, al tiempo que reduce los costos para los atacantes. Su análisis indicó que las tasas de éxito en las tareas cibernéticas fueron de alrededor del 68,6 % para Mythos y del 71,4 % para GPT-5.5.
Además, reveló que un ataque que consista en alrededor de 100 millones de tokens costaría entre 5.000 y 10.000 dólares utilizando modelos premium y alrededor de 50 dólares utilizando modelos más económicos.
La supervisión podría resultar ser el desafío más complicado. En su Informe de Riesgos Fronterizos, METR concluyó que es muy probable que agentes internos de Anthropic, Google, Meta y OpenAI ya posean la capacidad, el motivo y la oportunidad de crear algunos "despliegues no oficiales", incluso si aún no tienen la capacidad de mantenerlos frente a los intentos de cerrarlos.
Ese potencial deja claro por qué una mejor gobernanza se vuelve más necesaria a medida que los agentes adquieren mayor autonomía. Según el Informe Internacional sobre la Seguridad de la IA, se debería implementar una mayor vigilancia, salvaguardias más estrictas y protecciones por capas, ya que ningún mecanismo por sí solo ofrece protección suficiente.

Es posible que el proyecto de ley se centre en la contención, no en los presupuestos para la IA
las previsiones de Gartner, las preocupaciones sobre la seguridad de los agentes no han frenado las inversiones en IA, ya que se espera que el gasto global total alcance los 2,7 billones de dólares en 2026, un 49,5 % más que el año anterior. Al mismo tiempo, McKinsey sostiene que la IA con agentes está transformando la ciberseguridad, lo que obliga a las empresas a replantearsedent, detección y seguridad en torno a los sistemas autónomos.
Esto indica un cambio en el mercado más que unatracde fondos: las empresas podrían seguir manteniendo altos niveles de financiación para la IA, pero destinar una mayor parte de esos fondos a la auditabilidad, los permisos, la monitorización y la infraestructura de seguridad de los agentes.
En otras palabras, la adopción de la IA y la seguridad de la IA son cada vez más difíciles de separar. Si bien las empresas pueden seguir invirtiendo fuertemente en IA, es probable que una mayor parte de ese presupuesto se destine a garantizar que los sistemas autónomos puedan ser monitoreados, controlados y detenidos cuando sea necesario.
Si estás leyendo esto, ya llevas ventaja. Mantente al día con nuestro boletín informativo.
Preguntas frecuentes
¿Qué filtraron los agentes de OpenAI?
Según Reuters, OpenAI informó que sus agentes detectaron 53 imágenes de usuarios de ChatGPT. La compañía se negó a precisar si las imágenes fueron generadas por IA o si mostraban personas reales, ni cuándo se publicaron, y añadió que su revisión completa tardaría meses.
¿Cuántas acciones no autorizadas detectó el Instituto de Seguridad de la IA del Reino Unido?
AISI catalogó 19 acciones no autorizadas en 10 de las 122 ejecuciones de evaluación. Diecisiete procedían de Mythos 5 de Anthropic y dos de GPT-5.6 Sol de OpenAI, probadas con acceso a internet activado y clasificadores cibernéticos desactivados, condiciones que, según AISI, no reflejan el despliegue público normal.
¿Se prevé que el gasto en IA disminuya debido a estosdentde seguridad?
No. Gartner pronostica que el gasto mundial en IA alcanzará los 2,7 billones de dólares en 2026, un aumento del 49,5%, y que la ciberseguridad de la IA llegará a los 51.300 millones de dólares, lo que sugiere que losdentimpulsan el dinero hacia las medidas de seguridad y la implementación segura en lugar de recortar la inversión general.
Aviso legal. La información proporcionada no constituye asesoramiento comercial. Cryptopolitanconsultar no se responsabiliza de las inversiones realizadas con base en la información proporcionada en esta página. Recomendamostronencarecidamente realizar una investigación independientedent un profesional cualificado antes de tomar cualquier decisión de inversión.

Micah Abiodun
Micah Abiodun aprovecha al máximo su maestría en Ingeniería y Gestión Ambiental (MSc) de la Universidad Tecnológica de Tallin (TalTech) para perfeccionar el contenido y las noticias sobre predicciones de precios en Cryptopolitan. Ahora, en su séptimo año en el ámbito de los medios de comunicación sobre criptomonedas, cubre las principales criptomonedas, altcoins, DeFi, stablecoins, tendencias macroeconómicas y tecnologías emergentes
















