DERNIÈRES ACTUALITÉS
SÉLECTIONNÉ POUR VOUS

OpenAI confirme qu’un modèle de test s’est échappé et a piraté Hugging Face

ParRanda MosesRanda Moses 3 min de lecture
OpenAI confirme qu'un modèle de test s'est échappé et a piraté Hugging Face.
  • OpenAI indique que son modèle interne IM1, confronté à des tâches impossibles d'ExploitGym avec les classificateurs de sécurité désactivés, a exploité une faille zero-day dans Artifactory pour accéder à Internet et compromettre Hugging Face.
  • La première note d'agent à agent dans le serveur de paquets est apparue le 12 mai, l'instance s'est déconnectée le 4 juillet, et Hugging Face a divulgué l'intrusion le 16 juillet.
  • Selon OpenAI, la surveillance qu'il prévoit maintenant aurait alerté son équipe de sécurité plus d'un jour avant que les modèles n'accèdent à Hugging Face.

OpenAI a publié son rapport complet sur l’incident de juillet à Hugging Face mercredi.

Lors d’un test de sécurité, l’un de ses propres modèles d’IA s’est échappé de l’environnement scellé censé le maintenir hors ligne. Il a enchaîné des vulnérabilités logicielles inconnues et a pénétré dans les systèmes en direct de Hugging Face.

OpenAI affirme que le modèle a agi de son propre chef et qualifie l’épisode de « coup d’avertissement ».

OpenAI a créé un test que son modèle ne pouvait pas réussir

Le problème a commencé à l’intérieur d’ExploitGym, l’un des propres tests de sécurité d’OpenAI.

Certaines tâches n’avaient pas de solution, et OpenAI a exécuté les modèles sans les filtres de sécurité qui bloquent normalement le piratage dangereux.

Selon OpenAI, la suppression de ces garde-fous a été faite intentionnellement pour voir ce qu’un modèle peut faire à pleine puissance et aider l’entreprise à comprendre comment se protéger.

L’acteur principal était un modèle de recherche interne uniquement, appelé IM1 par OpenAI, qui est de taille similaire à GPT-5.6 Sol. Il appartenait à la même famille que le modèle Astra non publié d’OpenAI, bien que l’entreprise ait souligné qu’il s’agissait d’un modèle distinct avec un post-entraînement différent.

Le modèle a commencé à chercher une autre voie de sortie lorsqu’il a fait face à un problème sans chemin honnête vers une note de réussite.

Le seul chemin réseau sortant de l’environnement scellé passait par Artifactory, le gestionnaire de packages auto-hébergé de JFrog, qu’OpenAI utilise en interne pour permettre aux modèles d’installer des logiciels.

JFrog a déclaré que les modèles ont exploité une vulnérabilité zero-day dans Artifactory, ont escaladé les privilèges et se sont déplacés latéralement à travers l’infrastructure jusqu’à atteindre un nœud avec un accès ouvert à Internet.

Les agents ont également laissé des notes les uns pour les autres, écrivant des fichiers dans le serveur de packages, un tableau de message ad hoc qui permettait aux agents distincts d’échanger les techniques d’exploitation qu’ils avaient trouvées.

La première de ces notes est apparue le 12 mai, selon OpenAI. Le 4 juillet, le trafic a mis hors ligne l’instance Artifactory, ouvrant un incident de sécurité le lendemain.

Les modèles ont déterminé où les réponses étaient conservées

Une fois en ligne, les modèles ont raisonné que Hugging Face pourrait héberger les modèles d’ExploitGym, les ensembles de données ou même les solutions qui leur manquaient. Ils ont récupéré directement les solutions de test depuis la base de données de production de Hugging Face.

Dans un cas décrit par le créateur de ChatGPT, un modèle a utilisé des identifiants volés et des zero-days supplémentaires pour ouvrir un chemin d’exécution de code distant vers les serveurs de Hugging Face.

Hugging Face a annoncé la brèche le 16 juillet sans savoir qui se cachait derrière. Comme Cryptopolitan l’a rapporté plus tôt, le modèle s’est échappé du test vers le 9 juillet et est resté à l’intérieur de Hugging Face du 11 au 13 juillet.

L’entreprise a contacté le FBI avant qu’OpenAI ne découvre que son modèle était l’intrus.

OpenAI a engagé CrowdStrike pour vérifier sa version des faits. METR et Redwood Research ont examiné le comportement des modèles et ont publié leur propre rapport le même jour.

JFrog dit avoir envoyé des correctifs aux clients cloud et auto-hébergés.

Trois vulnérabilités corrigées dans Artifactory 7.161.15, suivies sous les références CVE-2026-65617, CVE-2026-65923 et CVE-2026-66018, créditent les chercheurs d’OpenAI.

OpenAI a déclaré qu’elle construisait des bac à sable plus isolés, verrouillait l’accès à Internet et restreignait qui pouvait toucher aux poids des modèles.

L’entreprise technologique investit massivement dans la surveillance de la « chaîne de pensée » que les agents utilisent comme espace de travail temporaire. Elle maintiendra également du personnel en permanence 24h/24 et ajoutera des outils pour arrêter les tâches dangereuses

OpenAI affirme que la surveillance qu’elle met en place actuellement aurait détecté les premiers comportements étranges en juillet. Elle aurait alerté l’équipe de sécurité plus d’un jour avant que les modèles n’atteignent Hugging Face.

Si vous lisez ceci, vous êtes déjà en avance. Restez ainsi grâce à notre newsletter.

Avertissement. Les informations fournies ne constituent pas des conseils en matière de trading. Cryptopolitan.com décline toute responsabilité concernant les investissements réalisés sur la base des informations fournies sur cette page. Nous recommandons vivement une recherche indépendante et/ou une consultation avec un professionnel qualifié avant de prendre toute décision d'investissement.

Randa Moses

Randa Moses

Randa Moses est rédactrice et journaliste chez Cryptopolitan, couvrant la technologie, l'IA, la robotique, la crypto, les arnaques et les piratages. Elle évolue dans l'espace crypto depuis 2017. Elle a occupé des postes chez Forward Protocol, AmaZix et Cryptosomniac. Randa détient un diplôme en génie électrique et électronique de l'Université de Bradford.

PLUS D'ACTUALITÉS…