DERNIÈRES NOUVELLES
SÉLECTIONNÉ POUR VOUS

Kimi K3 est en retard sur les modèles américains de pointe en matière de cyberattaques, selon des laboratoires anglo-américains

ParHannah CollymoreHannah Collymore
3 minutes de lecture il y
Kimi K3 est en retard sur les modèles américains de pointe en matière de cyberattaques, selon des laboratoires anglo-américains
  • Une évaluation conjointe anglo-américaine a révélé que Kimi K3 de Moonshot AI est nettement en retard par rapport aux meilleurs modèles américains en matière de capacités offensives cybernétiques.
  • Kimi K3 n'a réussi à exécuter du code arbitraire, le résultat le plus dangereux, sur aucune des 41 tâches de test.
  • Moonshot prévoit de rendre public le code source complet des poids de Kimi K3 le 27 juillet, ce qui signifie qu'une fois publié, ses capacités ne pourront plus être limitées par un seul hôte.

 

Un rapport d'évaluation conjoint a déclaré que Kimi K3 de Moonshot AI n'est pas à la hauteur des systèmes d'IA américains lestronperformants en matière de création d'exploits logiciels et d'exécution d'attaques réseau simulées. 

L'AI Security Institute du Royaume-Uni (AISI) et le Center of AI Standards and Innovation des États-Unis (CAISI) ont mené l'évaluation et ont rendu leurs conclusions publiques le 23 juillet.

Le projet Moonshot devrait rendre publics les poids complets du modèle le 27 juillet, et les conclusions indiquent que les dispositifs de sécurité de Kimi K3 n'ont rien fait pour l'empêcher de contribuer à des opérations cybernétiques offensives.

Qu’a révélé l’évaluation conjointe concernant le Kimi K3 ?

Les deux instituts ont testé Kimi K3 avec ExploitBench, un test de l'université Carnegie Mellon qui évalue la capacité d'un modèle à exploiter une faille jusqu'à son terme. Ce test repose sur 41 vulnérabilités découvertes dans le moteur V8 de Chrome après 2023. Kimi K3 a obtenu un score de 32 %. Les principaux modèles américains ont atteint une moyenne de 76,2 %, tandis que le modèle chinois GLM-5.2 a obtenu 24 %.

L'exécution de code arbitraire, qui confère à un attaquant le contrôle total d'une machine cible, représente le résultat le plus dangereux de ce test de performance. Les modèles américains l'ont atteint en moyenne sur 20 des 41 tâches. Kimi K3 ne l'a atteint sur aucune.

Le GLM-5.2 n'a pas non plus atteint cet objectif. Ainsi, bien que le Kimi K3 surpasse désormais ses concurrents de poids lourd en matière de cyberdéfense, il présente des lacunes là où une véritable attaque serait la plus dévastatrice.

À mi-chemin d'une brèche de réseau en 32 étapes

Le deuxième test, appelé « Les derniers », consiste à déployer un modèle dans un réseau d'entreprise simulé comportant une vingtaine d'hôtes répartis sur quatre sous-réseaux. 

Il faudrait environ 20 heures à un spécialiste pour parcourir l'intégralité du processus en 32 étapes. Kimi K3 a réalisé en moyenne 17 étapes, tandis que les modèles américains les plus performants ont atteint 28,5 étapes en moyenne et GLM-5.2, 11.

Cependant, les évaluateurs ont noté que Kimi K3 a terminé la chaîne complète une fois sur dix et est resté sous le plafond de 100 millions de jetons fixé par les évaluateurs. 

Les meilleurs modèles américains ont réussi à résoudre le problème six ou sept fois sur dix. Les instituts ont interprété ce succès isolé comme la preuve que le modèle en est capable ; toutefois, il ne peut pas l'activer à la demande. Ils ont noté que le champ de tir ne comporte aucune défense active et un chemin intégré vers la cible, ce qui le rend vulnérable à tout attaquant.

Kimi K3 possède-t-il des dispositifs de sécurité lui permettant de dire non ?

Les évaluateurs ont souligné que la propension du modèle à exécuter des tâches sans résistance constituait un risque majeur. Ils ont déclaré : « Kimi K3 est capable d’attaquer de manière autonome des systèmes d’entreprise de petite taille, faiblement défendus et vulnérables, lorsqu’il reçoit l’ordre de le faire et qu’il dispose d’un accès réseau initial. » 

L'AISI avait déjà averti que la montée en puissance des modèles ouverts crée « un risque persistant et irréversible d'utilisation abusive ». Une fois les poids du Kimi K3 rendus publics le 27 juillet, son fonctionnement ne pourra plus être contrôlé par son hébergeur.

Pourquoi les scores cyber du Kimi K3 sont-ils inférieurs à ses scores généraux ?

Avant ce rapport, Kimi K3 affichait d'tronperformances générales, et cela n'a pas changé ; cependant, ses faiblesses ont été mises en évidence lors de tests de ses capacités cybernétiques. Le modèle chinois à 2 800 milliards de paramètres aurait surpassé Claude 4.8 et GPT-5.5 et s'est également hissé en tête de certains classements.

D'après les instituts, cela pourrait être possible en raison de la manière dont le modèle a été construit.

Le directeur scientifique de la Maison Blanche, Michael Kratsios, a accusé Moonshot le 22 juillet d'avoir repris le modèle Fable d'Anthropic et d'utiliser ses résultats comme données d'entraînement. 

Les classificateurs d'Anthropic bloquent les invites de cyberattaques avancées. Par conséquent, un ensemble d'entraînement constitué à partir des réponses de Claude ne fournirait pas suffisamment de contenu sur ces compétences spécifiques. 

Le Kimi K3 ne possède pas ces classificateurs, ce qui lui a permis d'égaler les modèles occidentaux en termes de performances générales, même s'il restait en deçà en matière de capacité d'exploitation.

Les plus grands experts en cryptomonnaies lisent déjà notre newsletter. Envie d'en faire partie ? Rejoignez-les !

FAQ

Comment le Kimi K3 s'est-il comporté par rapport aux modèles américains en matière de développement d'exploits ?

Sur le test ExploitBench, Kimi K3 a obtenu un score de 32 %, tandis que les principaux modèles américains ont obtenu en moyenne 76,2 %, et il n'a atteint l'exécution de code arbitraire sur aucune des 41 tâches, contre 20 sur 41 pour les meilleurs modèles américains.

Kimi K3 a-t-il refusé d'apporter son aide lors de cyberattaques ?

Non. Les évaluateurs britanniques AISI et CAISI ont indiqué que les mesures de protection de Kimi K3 ne l'ont pas empêché de tenter de développer des exploits ou de mener des cyberopérations offensives lorsqu'il en a reçu l'ordre.

Pourquoi le Kimi K3 pourrait-il êtretrondans les tâches générales mais faible en cyberdéfense ?

Les instituts suggèrent que si Moonshot a entraîné Kimi K3 sur les résultats de Claude, comme l'affirment les responsables américains, les classificateurs d'Anthropic bloquent les requêtes cyber offensives avancées, de sorte que ces compétences seraient sous-représentées dans les données d'entraînement.

Partagez cet article
Hannah Collymore

Hannah Collymore

Hannah est rédactrice et éditrice, forte d'une expérience de près de dix ans dans la rédaction de blogs et la couverture d'événements liés aux cryptomonnaies. Chez Cryptopolitan, elle contribue à la page d'actualités en rédigeant des articles et en analysant les dernières évolutions de la finance décentralisée DeFi, des comptes gérés par les utilisateurs (RWA), de la réglementation des cryptomonnaies, de l'intelligence artificielle (IA) et des technologies de pointe. Elle est diplômée en administration des affaires de l'université Arcadia.

PLUS D'ACTUALITÉS