Laboratorios británicos y estadounidenses descubrieron que Kimi K3 se queda atrás de los modelos fronterizos estadounidenses en tareas de ciberataque

- Una evaluación conjunta entre el Reino Unido y Estados Unidos concluyó que el modelo Kimi K3 de Moonshot AI se queda significativamente atrás de los mejores modelos estadounidenses en cuanto a capacidades cibernéticas ofensivas.
- Kimi K3 no logró la ejecución de código arbitrario, el resultado más peligroso, en ninguna de las 41 tareas de prueba.
- Moonshot planea publicar el código fuente completo de los pesos de Kimi K3 el 27 de julio, lo que significa que, una vez lanzado, sus capacidades ya no podrán estar restringidas por ningún sistema anfitrión.
Un informe de evaluación conjunto ha declarado que Kimi K3, de Moonshot AI, no está a la altura de los sistemas de IA estadounidenses mástronen lo que respecta a la creación de exploits de software y la ejecución de ataques de red simulados.
El Instituto de Seguridad de la IA del Reino Unido (AISI) y el Centro de Estándares e Innovación de la IA de EE. UU. (CAISI) llevaron a cabo la evaluación y publicaron sus conclusiones el 23 de julio.
Se espera que Moonshot publique todos los datos del modelo el 27 de julio, y los resultados indican que las medidas de seguridad de Kimi K3 no impidieron que colaborara en actividades cibernéticas ofensivas.
¿Qué reveló la evaluación conjunta sobre Kimi K3?
Los dos institutos sometieron a Kimi K3 a ExploitBench, una prueba de Carnegie Mellon que evalúa hasta qué punto un modelo puede explotar una vulnerabilidad. Se basa en 41 vulnerabilidades encontradas en el motor V8 de Chrome después de 2023. Kimi K3 obtuvo un 32 % de éxito. Los modelos líderes de EE. UU. alcanzaron un promedio del 76,2 %, mientras que el GLM-5.2 de China obtuvo un 24 %.
La ejecución de código arbitrario, que otorga al atacante el control total de la máquina objetivo, es el resultado más peligroso de la prueba. Los modelos estadounidenses lo alcanzaron en 20 de las 41 tareas, en promedio. Kimi K3 no lo alcanzó en ninguna.
GLM-5.2 tampoco lo logró. Así que, si bien Kimi K3 ahora lidera a sus rivales de peso libre en ciberseguridad, se queda corto en el punto donde un ataque real causaría el mayor daño.
A mitad de una brecha de seguridad de red de 32 pasos
La segunda prueba, denominada "Los últimos", consiste en introducir un modelo en una red corporativa simulada con unos 20 hosts distribuidos en cuatro subredes.
Un especialista humano tardaría unas 20 horas en completar el proceso de 32 pasos. Kimi K3 completó un promedio de 17 pasos, mientras que los modelos estadounidenses más capaces promediaron 28,5 y GLM-5.2 logró 11.
Sin embargo, los evaluadores observaron que Kimi K3 completó toda la cadena una vez en diez intentos y se mantuvo por debajo del límite de 100 millones de tokens que establecieron los evaluadores.
Los mejores modelos estadounidenses lo resolvieron seis o siete veces de cada diez. Los institutos interpretaron ese único éxito como prueba de que el modelo tiene la capacidad; sin embargo, no puede activarla a demanda. Señalaron que el campo de tiro no cuenta con defensores activos y tiene una ruta predefinida hacia el objetivo, por lo que resulta vulnerable ante cualquier atacante.
¿Tiene Kimi K3 mecanismos de seguridad que le permitan decir que no?
Los evaluadores señalaron que la disposición del modelo a realizar tareas sin resistencia representaba un riesgo importante. Afirmaron: «Kimi K3 es capaz de atacar de forma autónoma sistemas empresariales pequeños, con defensas débiles y vulnerables cuando se le ordena hacerlo y se le otorga acceso inicial a la red»
AISI ya advirtió que el creciente potencial de los modelos abiertos crea "un riesgo persistente e irreversible de mal uso". Una vez que los pesos de Kimi K3 se hagan públicos el 27 de julio, su comportamiento ya no podrá ser controlado por quien lo aloje.
¿Por qué las puntuaciones de ciberseguridad del Kimi K3 son inferiores a sus puntuaciones generales?
Antes de este informe, Kimi K3 teníatronresultados en general, y eso no ha cambiado; sin embargo, puso de manifiesto sus deficiencias al poner a prueba sus capacidades cibernéticas. Según se informa, el modelo chino de 2,8 billones de parámetros superó a Claude 4.8 y GPT-5.5, y también lideró algunas clasificaciones.
Según los institutos, esto podría ser posible como resultado de la forma en que se construyó el modelo.
El director científico de la Casa Blanca, Michael Kratsios, acusó el 22 de julio al proyecto Moonshot de haber extraído información del modelo Fable de Anthropic, utilizando sus resultados como datos de entrenamiento.
Los clasificadores de Anthropic bloquean las indicaciones cibernéticas ofensivas avanzadas. Esto significa que un conjunto de entrenamiento extraído de las respuestas de Claude no ofrecería suficiente material sobre esas habilidades específicas.
Kimi K3 no cuenta con esos clasificadores, lo que le permitió igualar a los modelos occidentales en tareas generales, aunque seguía siendo deficiente en cuanto a capacidad de explotación.
Las mentes más brillantes del mundo de las criptomonedas ya leen nuestro boletín. ¿Te apuntas? ¡ Únete!
Preguntas frecuentes
¿Qué puntuación obtuvo Kimi K3 frente a los modelos estadounidenses en el desarrollo de exploits?
En la prueba ExploitBench, Kimi K3 obtuvo una puntuación del 32%, mientras que los principales modelos estadounidenses promediaron el 76,2%, y no logró la ejecución de código arbitrario en ninguna de las 41 tareas, en comparación con las 20 de 41 que lograron los mejores modelos estadounidenses.
¿Se negó Kimi K3 a colaborar en la lucha contra los ciberataques?
No. Los evaluadores de AISI y CAISI del Reino Unido informaron que las medidas de seguridad de Kimi K3 no impidieron que intentara desarrollar exploits o realizar operaciones cibernéticas ofensivas cuando se le ordenaba.
¿Por qué Kimi K3 podría sertronen tareas generales pero débil en ciberseguridad?
Los institutos sugieren que si Moonshot entrenó a Kimi K3 con los resultados de Claude, como alegan los funcionarios estadounidenses, los clasificadores de Anthropic bloquean las consultas cibernéticas ofensivas avanzadas, por lo que esas habilidades estarían subrepresentadas en los datos de entrenamiento.

Hannah Collymore
Hannah es escritora y editora con casi una década de experiencia en redacción de blogs y reportajes sobre eventos en el ámbito de las criptomonedas. En Cryptopolitan, colabora en la sección de noticias, informando y analizando las últimas novedades en DeFi, RWA, regulación de criptomonedas, IA y tecnologías de vanguardia. Se graduó en Administración de Empresas por la Universidad de Arcadia.
















