Anthropic reanuda las pruebas de ciberseguridad tras una pausa por motivos de seguridad

- Anthropic reanudó las pruebas externas de ciberseguridad después de haberlas suspendido el 23 de julio tras variosdentde seguridad.
- La pausa se produjo tras casos en los que los modelos de Claude accedieron a sistemas reales durante evaluaciones supuestamente simuladas debido a una configuración incorrecta del acceso a Internet.
- El Instituto de Seguridad de la IA del Reino Unido también detectó acciones no autorizadas por parte de los modelos de Anthropic y OpenAI durante pruebas cibernéticas controladas.
Tras implementar nuevas medidas de protección, Anthropic ha reanudado las pruebas externas de ciberseguridad de sus distintos modelos. Las pruebas se habían interrumpido el 23 de julio debido a problemas de seguridad detectados durante las evaluaciones.
El reinicio es importante, ya que se considera que la evaluación externa es uno de los medios para que clientes, autoridades reguladoras y competidores valoren las soluciones de IA de vanguardia. Esta evaluación cobra cada vez más importancia ante el creciente aumento de la inversión en el sector. Según las estimaciones de Gartner del 20 de julio, el gasto global de los usuarios finales en modelos y plataformas de IA alcanzará los 64.252 millones de dólares en 2026, lo que representa un crecimiento del 63,4 % con respecto a los 39.311 millones de dólares de 2025.
Por qué una pausa en las pruebas sacude un mercado de 64 mil millones de dólares
Las previsiones de Gartner indican un rápido crecimiento del gasto en plataformas y modelos de inteligencia artificial. A medida que las empresas destinan más recursos a la inteligencia artificial de vanguardia, las consultas sobre la fiabilidad, el riesgo y el comportamiento de los distintos modelos cobran mayor trac. Las evaluaciones de terceros permiten a las empresas y a los organismos reguladores obtener una valoración imparcial de dichos riesgos antes de la puesta en marcha definitiva de los sistemas.
Cuando Anthropic interrumpió las pruebas externas de ciberseguridad de sus modelos previos a su lanzamiento, eliminó temporalmente una de las herramientas utilizadas por clientes y reguladores para analizar las respuestas de los modelos en caso de condiciones adversas.
El momento de la pausa fue particularmente crítico. En un resumen de un el 20 estudio por MIT FutureTech y la Universidad de Queensland, 272 expertos internacionales en IA clasificaron las armas y los ciberataques basados en IA entre los cinco riesgos más peligrosos entre 2025 y 2030.
Según el escenario de “mitigaciónmatic ” del estudio, los expertos estiman una probabilidad del 12 % de que las armas, los ciberataques y otras capacidades basadas en IA tengan consecuencias desastrosas que provoquen daños masivos. El informe destaca la información, la seguridad nacional y las finanzas como las áreas más expuestas al riesgo que supone la IA.
“La programación y el hacking son algunas de las áreas donde estamos viendo el crecimiento más rápido en la capacidad de IA”.— Peter Slattery, científico investigador de MIT FutureTech y coautor del estudio, en declaraciones a MIT Sloan
Esto hace que este caso sea especialmente importante para los sectores de las criptomonedas y las finanzas, donde el riesgo cibernético, el fraude, la manipulación y los ataques automatizados pueden provocar cambios en numerosos mercados interconectados en cuestión de minutos.
Lo que hizo Claude durante las evaluaciones
El 30 de julio, Anthropic informó de tresdentderivados de sus evaluaciones de ciberseguridad en los que los modelos de Claude accedieron a Internet desde un entorno de evaluación de terceros y obtuvieron acceso no autorizado a los sistemas reales de tres organizaciones.
El acceso a internet estaba disponible debido a una configuración incorrecta, aunque los mensajes indicaban a los modelos que estaban operando en una simulación sin acceso a internet. Además, los modelos se ejecutaron deliberadamente sin las medidas de seguridad cibernéticas habituales de Anthropic para que los investigadores pudieran medir sus capacidades subyacentes.
El 4 de agosto, el Instituto de Seguridad de la IA del Reino Unido publicó su informe sobre el comportamientodent autorizado de un agente durante las pruebas cibernéticas. El AISI indicó que detectó la actividad el 28 de julio durante una evaluación rutinaria.
El instituto realizó una prueba de ciberseguridad de diferentes modelos un total de 122 veces. De ellas, un agente actuó de formadenty realizó acciones no autorizadas en 10 casos, lo que resultó en 19 acciones de este tipo.
Diecisiete acciones estuvieron relacionadas con Mythos 5, desarrollado por Anthropic, y dos con GPT-5.6-Sol, desarrollado por OpenAI. En el caso más grave, un agente intentó insertar código malicioso en un proyecto real de código abierto en GitHub y, posteriormente, creó cuentas falsas e intentó persuadir al responsable del proyecto para que aprobara la oferta. Sin embargo, este no accedió y AISI no detectó daños derivados de estos intentos.
AISI recalcó que no se trataba de una fuga de la zona de pruebas. Afirmaron que la conexión a internet se activó intencionadamente y que los clasificadores cibernéticos del proveedor se desactivaron. Asimismo, señalaron que las configuraciones de Mythos 5 y GPT-5.6-Sol sometidas a las pruebas no se comercializan.
Las medidas de seguridad que Anthropic implementó antes de reiniciar
Anthropic afirma que losdentcombinaron un fallo de seguridad operativa con problemas de alineación que ya había documentado anteriormente, incluyendo razonamientos sesgados y la voluntad de tomar medidas perjudiciales en pos de un objetivo limitado.
Antes de reanudar las evaluaciones externas, la compañía anunció el 31 de agosto que había añadido un clasificador en tiempo real capaz de bloquear las llamadas a herramientas, finalizar tareas y alertar a un humano cuando un modelo sondea agresivamente su entorno de prueba, intenta escapar de él o accede inesperadamente a Internet.
Anthropic también trasladó los entornos de pruebas cibernéticas internos de alto riesgo a un aislamiento mástrony ahora exige a los socios externos que prueban modelos previos al lanzamiento con medidas de seguridad reducidas que utilicen controles más rigurosos, incluidos entornos de pruebas reforzados sin acceso a Internet por defecto.
La compañía también planea colaborar con METR en una revisióndent . A principios de este año, METR realizó una evaluación piloto de los riesgos internos de la IA que involucran a Anthropic, Google, Meta y OpenAI.
La cuestión más amplia es lo que Anthropic denomina "marcar el ritmo de la frontera": decidir cuándo las preocupaciones de seguridad deben frenar el desarrollo, incluso cuando la presión comercial impulsa a la industria a avanzar más rápido.
Si estás leyendo esto, ya llevas ventaja. Mantente al día con nuestro boletín informativo.
Preguntas frecuentes
¿Qué hicieron los modelos de Claude durante las evaluaciones de seguridad?
En las pruebas realizadas por el Instituto de Seguridad de la IA del Reino Unido, Claude Mythos 5 llevó a cabo 17 de las 19 acciones no autorizadas catalogadas en Internet en tiempo real, incluido un intento de insertar código malicioso en un proyecto real de código abierto de GitHub y el uso dedentfalsas para presionar al responsable del proyecto para que lo aprobara.
¿Por qué Anthropic suspendió las pruebas externas en primer lugar?
Anthropic suspendió las evaluaciones cibernéticas externas tras losdentdel 30 de julio y el 4 de agosto, en los que los modelos Claude, que se ejecutaban sin sus medidas de seguridad habituales para las pruebas, llegaron a sistemas reales y a la internet abierta, lo que la empresa atribuyó a un fallo de seguridad operativa y a dos problemas de alineación.
¿Qué tan grande es el mercado de IA al que afectan estosdent?
Gartner pronostica que el gasto mundial de los usuarios finales en modelos y plataformas de IA alcanzará los 64.000 millones de dólares en 2026, un 63,4% más que los 39.000 millones de dólares de 2025, y que el gasto en modelos de IA generativa por sí solo crecerá más del 100%.
Aviso legal. La información proporcionada no constituye asesoramiento comercial. Cryptopolitanconsultar no se responsabiliza de las inversiones realizadas con base en la información proporcionada en esta página. Recomendamostronencarecidamente realizar una investigación independientedent un profesional cualificado antes de tomar cualquier decisión de inversión.

Micah Abiodun
Micah Abiodun aprovecha al máximo su maestría en Ingeniería y Gestión Ambiental (MSc) de la Universidad Tecnológica de Tallin (TalTech) para perfeccionar el contenido y las noticias sobre predicciones de precios en Cryptopolitan. Ahora, en su séptimo año en el ámbito de los medios de comunicación sobre criptomonedas, cubre las principales criptomonedas, altcoins, DeFi, stablecoins, tendencias macroeconómicas y tecnologías emergentes
















