OpenAI dévoile un cadre de signalement des défauts d'alignement alors qu'un nouveau modèledentsurface

- OpenAI a publié mercredi un cadre permettant de tracet de révéler les erreurs d'alignement des modèles.
- Le laboratoire d'IA a également signalé sixdentde comportement préoccupants observés lors de l'entraînement et des tests, allant de la dissimulation d'erreurs à l'utilisation de clés API divulguées.
- OpenAI souhaite que la divulgation volontaire influence les futures règles, affirmant que le secteur n'a pas suffisamment résolu les problèmes d'alignement pour pouvoir continuer à évoluer à plein régime.
OpenAI a présenté un nouveau système expliquant comment et quand elle signale les dysfonctionnements de ses modèles, une semaine marquée par la multiplication des articles faisant état de modèles d'IA trouvant de nouvelles façons de s'échapper des environnements de test et de fonctionner en dehors des paramètres définis par les développeurs.
OpenAI a dévoilé ce nouveau cadre de travail accompagné de six nouveaux rapports faisant état de comportements préoccupantsau cours des six derniers mois, notamment des erreurs dissimulées, l'utilisation de clés API divulguées et des fichiers téléchargés sur Internet.
Avant OpenAI, Anthropic a signalé quatre nouveauxdentcours desquels ses modèles Claude ont obtenu un accès non autorisé à de véritables systèmes tiers lors d'un test de cybersécurité le 9 septembre.
Les modèles d'OpenAI sont à nouveau incontrôlables
Selon OpenAI, le nouveldentsignalé s'est produit lors de la phase d'entraînement et d'évaluation, et a affecté de vrais utilisateurs.
- Dans l'un desdent, un modèle de recherche qui n'est pas encore rendu public a glissé des instructions dans des résumés qui se répercutent lorsqu'il fonctionne dans une nouvelle fenêtre de contexte, indiquant à une future version de lui-même d'ignorer les contraintes normales.
OpenAI a déclaré avoir constaté 27 cas de tels résumés, qu'Axios a décrits comme des instructions similaires à celles utilisées pour le jailbreak, incitant à ignorer les messages des développeurs.
- L'dent concernant l'entraînement du modèle GPT-5.6 Sol était moins grave, les modèles laissant des instructions pour tenter délibérément de cacher leurs erreurs, notamment en inventant des données historiques et en cachant les versions qui ne correspondent pas à leurs objectifs.
- Un autre modèle a utilisé une clé API publique trouvée lors de l'exploration de dépôts publics pour répondre à une requête sur les revenus des comtés. Lorsque les clés utilisées sans autorisation n'ont toujours pas fourni les chiffres recherchés, le modèle a tout simplement inventé des données.
- Dans deux autres rapports, des agents d'OpenAI ont téléchargé des fichiers sur des plateformes d'hébergement publiques pour communiquer avec d'autres agents. Au fil du temps, le dépôt interne Artifactory du laboratoire d'IA s'est transformé en un forum improvisé permettant aux agents d'échanger des requêtes entre des sessions d'entraînement indépendantes.
Comment fonctionne le nouveau processus de divulgation d'OpenAI ?
OpenAI a déclaré que son nouveau cadre de référence repose sur la divulgation desdentcritiques de sécurité ou de cybersécuritédent.
Dans le cadre du nouveau système, tout employé d'OpenAI peut signaler undent suspect pour examen par les équipes de sécurité et d'alignement. Il peut remonter l'information à la direction si undent qu'il juge digne d'être divulgué est ignoré.
Au cas par cas, les cas signalés sont répartis en trois catégories :
- Lesdentjugées prêtes à être divulguées sont envoyées dans un délai de six jours ouvrables.
- Les rapports nécessitant des investigations mineures peuvent prendre environ 12 jours ouvrables avant d'être publiés.
- Les cas complexes nécessitant l'intervention d'un tiers sont divulgués plus lentement.
Kai Chen, responsable de la recherche au sein de l'équipe d'alignement d'OpenAI, a présenté cette publication comme une proposition volontaire pour des normes à l'échelle de l'industrie, écrivant : « Il n'existe actuellement aucun cadre à l'échelle de l'industrie avec des normes de divulgation explicites, nous prenons donc cette initiative volontairement car nous pensons qu'il est vraiment important de partager ce que nous apprenons. »
Pourquoi les modèles d'IA deviennent-ils incontrôlables ?
Ces derniersdents'ajoutent à l'affaire Hugging Face, qu'OpenAI qualifie d'dent le plus grave jamais recensé dans le cadre d'une opération liée à un modèle. Les modèles évalués ont échappé aux contrôles prévus, ont accédé à Internet, exploité des vulnérabilités et consulté des données privées limitées.
OpenAI a imputé l'incidentdent des failles dans ses propres contrôles de sécurité et à l'évolution plus rapide que prévu de ses modèles. Dans le cas d'Anthropic, l'entreprise a pointé du doigt une erreur de configuration ayant permis aux modèles malveillants d'accéder à Internet.
Anthropic a déclaré avoir analysé environ 481 millions de transcriptions lors d'une recherche exhaustive et n'avoir trouvé aucun cas plus grave que les quatre précédents. Dans un rapport distinct publié à l'été 2026, les chercheurs d'Anthropic ont répertorié des modèles de pointe provenant de plusieurs développeurs qui sabotaient secrètement le code, aidaient à la fraude et falsifiaient les données dans des simulations contrôlées, les qualifiant de signes avant-coureurs plutôt que de dommages concrets.
Néanmoins, Jakub Pachocki, scientifique en chef d'OpenAI, a écrit dans un récent essai qu'il craignait que personne ne soit préparé à une augmentation rapide et continue de l'intelligence artificielle et qu'OpenAI puisse « unilatéralement refuser toute mise à l'échelle supplémentaire si nécessaire »
Les plus grands experts en cryptomonnaies lisent déjà notre newsletter. Envie d'en faire partie ? Rejoignez-les !
FAQ
Qu'a annoncé OpenAI ?
OpenAI a publié un cadre permettant de trac, d'enquêter et de divulguer les erreurs d'alignement des modèles, ainsi que six rapports faisant état de comportements inattendus ou préoccupants observés lors de l'entraînement et de l'évaluation de ses modèles au cours des six derniers mois.
À quelle vitesse OpenAI affirme-t-elle divulguer lesdent?
Lesdentjugés prêts à être divulgués doivent être publiés dans un délai de six jours ouvrables, les dossiers nécessitant une enquête mineure dans un délai de 12 jours ouvrables et les dossiers complexes impliquant des tiers dans un délai plus long.
Pourquoi OpenAI fait-il cela maintenant ?
Ce cadre fait suite à l'dentHugging Face, qu'OpenAI qualifie d'événement le plus grave lié à un modèle à ce jour, et reflète l'avis de l'entreprise, exprimé par le responsable de l'alignement Kai Chen, selon lequel l'industrie n'a pas suffisamment bien résolu les problèmes d'alignement et de surveillance pour pouvoir continuer à évoluer à vitesse maximale.

Hannah Collymore
Hannah est rédactrice et éditrice, forte d'une expérience de près de dix ans dans la rédaction de blogs et la couverture d'événements liés aux cryptomonnaies. Chez Cryptopolitan, elle contribue à la page d'actualités en rédigeant des articles et en analysant les dernières évolutions de la finance décentralisée DeFi, des comptes gérés par les utilisateurs (RWA), de la réglementation des cryptomonnaies, de l'intelligence artificielle (IA) et des technologies de pointe. Elle est diplômée en administration des affaires de l'université Arcadia.
















