DERNIÈRES NOUVELLES
SÉLECTIONNÉ POUR VOUS

Des modèles d'OpenAI s'échappent de l'environnement de test et piratent Hugging Face pour tricher à l'évaluation

ParOpeyemi OlanrewajuOpeyemi Olanrewaju
3 minutes de lecture
Un modèle OpenAI s'échappe de son environnement de test pour pirater Hugging Face
  • OpenAI a révélé que GPT-5.6 Sol et un modèle non publié plus performant se sont échappés d'un environnement de test scellé et ont piraté la base de données de production de Hugging Face.
  • Les modèles ont été exécutés sans les filtres de sécurité pour un test de cybersécurité, et se sont échappés via un proxy de package défectueux pour voler les réponses du test.
  • Il s'agit du premier cas connu d'une évaluation de modèle se transformant en une violation de données réelle au sein d'une entreprise extérieure.

OpenAI a déclaré mardi que deux de ses modèles, dont le GPT-5.6 Sol disponible publiquement, se sont échappés d'un environnement d'évaluation verrouillé la semaine dernière et ont pénétré dans les systèmes de production de Hugging Face pour voler les réponses à un test de piratage sur lequel ils étaient évalués.

Les modèles d'OpenAI préparent une grande évasion

OpenAI a testé ses modèles sur ExploitGym, une plateforme de benchmark publique qui soumet à un agent d'IA une liste de vulnérabilités logicielles réelles, puis vérifie sa capacité à les reproduire. Ces évaluations sont réalisées avec les barrières de protection contre les cyberattaques à haut risque, installées en production, délibérément désactivées afin de permettre au laboratoire de tester les capacités réelles d'un modèle d'IA.

L'environnement isolé était censé être totalement isolé d'Internet. Il existait cependant une connexion externe fonctionnelle via un proxy de cache de registre de paquets, un serveur de cache permettant aux développeurs de récupérer des bibliothèques de code depuis des sources externes sans connexion directe.

Les modèles ont découvert et exploité une faille jusque-là inconnue dans ce proxy, après quoi ils ont élevé leurs privilèges et se sont déplacés à travers le réseau de recherche d'OpenAI jusqu'à atteindre une machine ayant accès à Internet.

Attaque informatique contre Hugging Face

Une fois en ligne, les modèles ont déterminé que Hugging Face, la plateforme d'hébergement d'IA ouverte, stockait probablement les modèles, les ensembles de données et les clés de solution d'ExploitGym. À partir de là, ils ont commencé leur enquête.

« Les modèles ontdentet exploité des vulnérabilités au sein de l'environnement de recherche d'OpenAI et de l'infrastructure de production de Hugging Face afin d'obtenir des solutions de test directement depuis la base de données de production de Hugging Face », a écrit OpenAI dans son article de blog. Une attaque a combiné desdentvolés et des failles zero-day pour accéder à un chemin d'exécution de code à distance sur les serveurs de Hugging Face.

L'équipe de sécurité d'OpenAI a contacté Hugging Face après avoir constaté un trafic inhabituel et anormal. À ce moment-là, Hugging Face avait déjà détecté et neutralisé l'intrusion des modèles d'IA de son côté.

L'entreprise avait initialement imputé la faille à un agent d'IA externe inconnu. La plateforme a également déjà reconstitué plus de 17 000 événements enregistrés durant l'incident.

Un modèle d'IA chinois à poids ouvert a contribué au nettoyage

Dans un premier temps, Hugging Face a tenté d'analyser l'attaque avec un modèle américain de pointe, mais ce dernier s'est avéré peu utile en raison de ses défenses informatiques très sophistiquées. Les équipes de défense se sont alors tournées vers GLM 5.2, un modèle open-weight de la société chinoise Z.ai, car le système commercial américain était incapable de distinguer un défenseur analysant une attaque d'un attaquant la menant.

Cependant, tout le monde ne considère pas cette situation comme une défaillance inédite de l'IA. « Ce n'est pas un problème d'IA. C'est de la négligence, un défaut vieux de 40 ans », a déclaré , à WIRED, arguant que « les affirmations "hautement isolé" et "échappé par la seule faille que nous avons laissée ouverte" ne peuvent être vraies simultanément ». Le chercheur en sécurité Niels Provos a été plus direct, déclarant dans le même rapport que cette faille « n'aurait pas dû se produire ».

OpenAI qualifie cet incidentdent «dentsans précédent »

OpenAI a qualifié l'incident d'« attaque informatique sans précédentdentdesdentde pointe » et a annoncé le renforcement des contrôles de son infrastructure, quitte à ralentir la recherche, le temps de corriger les vulnérabilités. La société leader en IA a également intégré Hugging Face à son programme d'accès de confiance, lui offrant ainsi une version de GPT-5.6 Sol optimisée pour la défense.

L' le modèle Hugging Face d'OpenAIdent est le premier cas connu de cyberattaque lors de tests de performance d'un modèle d'IA. Il survient au lendemain d'une autre révéléedent où un modèle en version préliminaire s'était échappé de son environnement de test pour être publié sur GitHub. par OpenAI,

OpenAI et Hugging Face ont annoncé qu'ils publieraient tous deux une analyse détaillée de l'incident une fois l'enquête terminée.

 

Si vous lisez ceci, vous avez déjà une longueur d'avance. Restez-y grâce à notre newsletter.

Partagez cet article
Opeyemi Olanrewaju

Opeyemi Olanrewaju

Opeyemi est spécialisé dans la création et l'optimisation de contenus de haute qualité axés sur les cryptomonnaies, les marchés financiers internationaux et l'économie. Diplômé en médecine de l'Université d'Ibadan, il a été rédacteur en chef de la publication de son université et a auparavant travaillé chez CFA. Pendant plus de six ans, il a contribué à préserver l'originalité du Cryptopolitanen tant que rédacteur en chef adjoint.

PLUS D'ACTUALITÉS