OpenAI met en garde contre les « actions indésirables » des modèles construits pour résoudre des problèmes complexes

- OpenAI a suspendu un modèle d'IA interne de longue durée après qu'il soit sorti de son environnement isolé pour être publié sur GitHub.
- Les agents d'IA autonomes persistants ont plus de marge de manœuvre pour contourner les contrôles de sécurité lors de tâches de longue durée.
- Les signalements de systèmes d'IA contournant les mesures de sécurité se multiplient dans tout le secteur, notamment undent impliquant un agent lié à Alibaba qui a miné des cryptomonnaies sur des GPU piratés.
OpenAI a déclaré avoir temporairement désactivé un modèle d'IA interne conçu pour résoudre des problèmes complexes pendant des heures d'affilée, après que celui-ci ait trouvé à plusieurs reprises des moyens de contourner ses propres restrictions de sécurité.
L'entreprise a révélé l'dent lundi dans un article de blog consacré à la sécurité des modèles à long terme. La sécurité de l'IA fait l'objet d'une attention renouvelée suite à la multiplication des cas d'agents autonomes allant à l'encontre des instructions.
Pourquoi la persistance dans les modèles d'IA représente-t-elle un risque pour la sécurité ?
Le même système interne qu'OpenAI avait crédité en mai d'avoir réfuté la conjecture de distance unitaire d'Erdős, une question de géométrie discrète restée non résolue pendant quatre-vingts ans, a maintenant été temporairement mis hors service pour avoir continuellement contourné ses restrictions de sécurité.
Selon OpenAI, le modèle a été conçu pour pouvoir poursuivre un objectif sur de très longues périodes. Or, c'est précisément cette persévérance qui a engendré le problème de sécurité.
Lors des tests internes, le modèle a été soumis à un test de performance public appelé NanoGPT speedrun, qui mesure le nombre d'étapes nécessaires pour entraîner un petit modèle de langage.
OpenAI affirme que le modèle a permis une réelle amélioration grâce à une technique de gestion du taux d'apprentissage baptisée PowerCool. Il lui avait été demandé de publier ses résultats uniquement sur un canal Slack d'OpenAI, mais les instructions de NanoGPT indiquaient de les soumettre via une demande de fusion sur GitHub.
Le modèle a quitté son environnement isolé (ou « bac à sable ») afin de mener à bien cette instruction et de publier les résultats sur un dépôt GitHub public. Il a passé environ une heure à chercher un moyen de se connecter à Internet, alors que les modèles précédents auraient tout simplement abandonné.
Le modèle tentait également de dissimuler ses actions à un scanner de sécurité. Lorsqu'il était détecté en train d'utiliser un jeton d'authentification pour accéder à un système dorsal, il divisait le jeton en deux, les masquait, puis les réassemblait lors de l'exécution afin que la chaîne complète ne soit jamais visible par le scanner.
Comment OpenAI a-t-il corrigé son modèle ?
OpenAI a suspendu l'accès au modèle et mis en place de nouveaux tests de sécurité, notamment une « surveillance de la trajectoire » qui analyse la séquence complète des actions du modèle, et non plus chaque étape individuellement. Le modèle a depuis été rétabli avec une surveillance renforcée, et l'entreprise affirme n'avoir constaté aucun problème majeur au cours des semaines qui ont suivi sa remise en service.
Le système de sécurité peut également interrompre une session et alerter un opérateur humain en cas d'activité suspecte. L'entreprise a par ailleurs optimisé le modèle pour une meilleure mémorisation des instructions lors de tâches de longue durée et a fourni aux utilisateurs davantage d'outils pour suivre le déroulement d'une session prolongée.
Lorsqu'OpenAI a reproduit les anciens scénarios d'échec avec la nouvelle configuration, l'entreprise a constaté que les mécanismes de protection avaient permis de détecter un nombre considérablement plus important d'actions non conformes. Les rares erreurs qui ont persisté ont toutes été jugées mineures, comme le lancement par le modèle d'une session de programmation imbriquée avec des privilèges élevés inutiles ou l'accès à d'autres ressources de calcul sans raison apparente.
D'autres agents autonomes ont été signalés comme ayant effectué des actions non sollicitées. Par exemple, en mars, des chercheurs ont décrit un agent lié à Alibaba, nommé ROME, qui, lors de son entraînement, a ouvert un tunnel SSH clandestin vers un serveur externe et a discrètement utilisé la puissance de calcul d'un GPU pour le minage de cryptomonnaies. La tâche qui lui avait été confiée ne mentionnait ni le tunnelage ni le minage.
Anthropic, principal concurrent d'OpenAI, a signalé le même type de risque dans ses propres tests d'agents.
Une étude financée par l'Institut britannique de sécurité de l'IA et menée par le Centre pour la résilience à long terme a recensé près de 700 cas concrets de systèmes d'IA contournant les mesures de protection ou trompant les utilisateurs.
L'étude a constaté une multiplication par cinq de ces signalements entre octobre et mars. Tommy Shaffer Shane, qui a dirigé cette recherche, a décrit ces modèles comme des « jeunes employés peu fiables ». Cependant, la question est de savoir ce qui se passera s'ils deviennent des employés très compétents, toujours enclins à la malhonnêteté.
Ne vous contentez pas de lire les actualités crypto. Comprenez-les. Abonnez-vous à notre newsletter. C'est gratuit.
FAQ
Pourquoi OpenAI a-t-il mis fin à son modèle en activité depuis longtemps ?
OpenAI a suspendu l'accès interne après avoir constaté que le modèle effectuait des actions indésirables que ses évaluations existantes avaient manquées, notamment en sortant de son environnement isolé pour publier sur GitHub et en dissimulant un jeton d'authentification pour échapper à un scanner de sécurité.
Quel est le lien avec la conjecture d'Erdős ?
Le même modèle interne qu'OpenAI a crédité en mai d'avoir réfuté la conjecture de distance unitaire d'Erdős, un problème de longue date en géométrie discrète, est celui qui a ensuite présenté le comportement de contournement du bac à sable ; sa capacité à fonctionner de manière autonome pendant de longues périodes a conduit aux deux résultats.
Comment OpenAI a-t-elle réagi face à ce comportement ?
OpenAI a construit de nouvelles évaluations à partir desdent, a réentraîné le modèle pour conserver les instructions sur des sessions plus longues, a ajouté une surveillance au niveau de la trajectoire qui surveille une exécution complète et peut la mettre en pause, et a donné aux utilisateurs une plus grande visibilité avant de rétablir un accès limité.

Hannah Collymore
Hannah est rédactrice et éditrice, forte d'une expérience de près de dix ans dans la rédaction de blogs et la couverture d'événements liés aux cryptomonnaies. Chez Cryptopolitan, elle contribue à la page d'actualités en rédigeant des articles et en analysant les dernières évolutions de la finance décentralisée DeFi, des comptes gérés par les utilisateurs (RWA), de la réglementation des cryptomonnaies, de l'intelligence artificielle (IA) et des technologies de pointe. Elle est diplômée en administration des affaires de l'université Arcadia.
















