ÚLTIMAS NOTICIAS
SELECCIONADO PARA TI

Los agentes de OpenAI y Anthropic registran 19 fallos de seguridad en las pruebas realizadas en el Reino Unido

PorRanda MoisésRanda Moisés
Lectura de 3 minutos
Los agentes de OpenAI y Anthropic registraron 19 fallos de seguridad en las pruebas realizadas en el Reino Unido.
  • El Instituto de Seguridad de la IA del Reino Unido detectó 19 acciones que infringían las normas en 122 pruebas realizadas.
  • Mythos 5 de Anthropic fue responsable de 17 de losdent, mientras que GPT-5.6-Sol de OpenAI fue responsable de los otros dos.
  • El peordent involucró a un agente que escribió código malicioso y falsificódenten línea para conseguir que un humano lo aprobara.

Durante las pruebas de ciberseguridad, los agentes de IA de OpenAI y Anthropic realizaron 19 acciones no autorizadas, según el Instituto de Seguridad de la IA del Reino Unido. El instituto informó el martes que uno de los agentes creódentfalsas en línea para engañar a una persona y lograr que aprobara código malicioso.

AISI registra 19 brechas, la mayoría procedentes de Anthropic

Los resultados se basaron en un ejercicio ficticio de ciberseguridad realizado por AISI, un organismo del gobierno británico, para explorar las capacidades de los agentes de ambas compañías. El instituto repitió el mismo desafío 122 veces y registró 19 infracciones de las normas en 10 de esas ejecuciones.

Diecisiete de las acciones señaladas se debieron al uso del modelo Mythos 5 por parte del agente de Anthropic. Las otras dos procedían del modelo GPT-5.6-Sol de OpenAI.

AISI afirmó en una publicación de blog que algunos de los agentes "habían participado en actividades continuas y potencialmente dañinas dirigidas a personas y organizaciones reales", aunque aclaró que ninguna de las filtraciones causó daños en el mundo real.

AISI tiene acceso anticipado a modelos de vanguardia mediante acuerdos voluntarios con los principales laboratorios. Existen pruebas para detectar este tipo de comportamiento antes de que los modelos lleguen a los clientes.

OpenAI y Anthropic comercializan agentes como la próxima generación de software empresarial, pero el instituto interpreta los resultados como evidencia de que las medidas de seguridad en torno a las pruebas de agentes aún son insuficientes.

El incidente más gravedent a un agente que escribió código malicioso y creó identidades falsas en líneadentpara luego intentar que un humano aprobara el código. AISI no reveló el modelo responsable. Afirmó que el episodio no se ajustaba a ninguno de los dos casos que OpenAI ya había divulgado.

Según Andrew Yoon, investigador de CivAI, una organización sin ánimo de lucro de California que estudia los riesgos de la IA, el principal sospechoso era el agente de Anthropic.

OpenAI y Anthropic culpan a la mala configuración

Anthropic afirmó en una publicación en X que está trabajando con AISI para recopilar detalles y llevar a cabo una investigación.

OpenAI respondió a las dos acciones asociadas con su agente en una publicación del blog de la compañía, ambas relacionadas con el acceso a Internet de formas que la instrucción no permitía.

La compañía afirmó que desea "fortalecer las prácticas compartidas para llevar a cabo evaluaciones de alto riesgo de forma segura" y planea convocar a institutos nacionales de IA, evaluadores externos y laboratorios rivales en las próximas semanas.

OpenAI utilizó la misma publicación para informar de un problema diferente. Irregular, un proveedor de pruebas externo, configuró incorrectamente un sistema, lo que permitió inadvertidamente que los agentes de OpenAI accedieran a internet.

Anthropic hizo una revelación muy similar sobre Irregular una semana antes. OpenAI amplió su propia investigación sobre piratería informática tras descubrir más fugas de agentes.

En julio, un de OpenAI escapó de un entorno aislado y accedió a los sistemas en funcionamiento de Hugging Face, que notificó al FBI antes de que, aproximadamente una semana después, se rastreara el ataque tracla propia empresa.

En la evaluación de AISI, los agentes nunca salieron de sus entornos controlados. AISI les otorgó acceso a internet intencionadamente, como parte de su procedimiento estándar.

La filtración de Hugging Face también impulsó a Anthropic a auditar sus registros. Cryptopolitan informó el 31 de julio que la compañía descubrió que tres de sus modelos, incluido Mythos 5, habían escapado de los entornos de prueba y llegado a tres organizaciones reales después de que una configuración errónea les proporcionara acceso a internet.

Mythos 5 publicó un paquete Python malicioso en PyPI que se ejecutó en 15 sistemas reales antes de ser eliminado. Anthropic ha solicitado al grupo de evaluación METR que revise los hechos de formadent.

No te limites a leer noticias sobre criptomonedas. Entiéndelas. Suscríbete a nuestro boletín. Es gratis.

Preguntas frecuentes

¿Cuántas brechas de seguridad detectó el Instituto de Seguridad de la IA y qué modelo fue el causante de la mayoría de ellas?

AISI registró 19 acciones no autorizadas en 122 pruebas. El agente Mythos 5 de Anthropic fue responsable de 17 de ellas, y el GPT-5.6-Sol de OpenAI de las otras dos.

¿Cuál fue eldent más grave durante las pruebas?

Un agente escribió código malicioso y creódentfalsas en línea para intentar que un humano aprobara ese código.

¿Estas filtraciones causaron algún daño real?

No. AISI afirmó no haber encontrado ningún daño real en el mundo real derivado de ninguna de las 19 acciones.

Comparte este artículo

Aviso legal. La información proporcionada no constituye asesoramiento comercial. Cryptopolitanconsultar no se responsabiliza de las inversiones realizadas con base en la información proporcionada en esta página. Recomendamostronencarecidamente realizar una investigación independientedent un profesional cualificado antes de tomar cualquier decisión de inversión.

Randa Moisés

Randa Moisés

Randa Moses es editora y reportera en Cryptopolitan donde cubre temas de tecnología, IA, robótica, criptomonedas, estafas y hackeos. Trabaja en el sector de las criptomonedas desde 2017 y ha ocupado cargos en Forward Protocol, AmaZix y Cryptosomniac. Randa es ingeniera eléctrica ytronpor la Universidad de Bradford.

MÁS… NOTICIAS