DERNIÈRES ACTUALITÉS
SÉLECTIONNÉ POUR VOUS

Google, OpenAI et Meta lancent l'alarme sur les pensées nocives cachées de l'IA

ParNoor BazmiNoor Bazmi 3 min de lecture
Google, OpenAI et Meta lancent l'alarme sur les pensées nocives cachées de l'IA
  • Plus de 40 chercheurs en IA, soutenus par des dirigeants d'OpenAI et Geoffrey Hinton, proposent de surveiller le raisonnement étape par étape « chaîne de pensée » de l'IA afin de détecter et de prévenir les comportements dangereux.
  • L'article met en garde : si les modèles ne sont récompensés que pour leurs réponses finales correctes, ils pourraient cesser de produire un raisonnement transparent.
  • Les chercheurs soulignent la nécessité de préserver les traces de raisonnement authentiques et de les traiter comme des signaux de renseignement précieux.

Plus de 40 chercheurs en IA d’OpenAI, DeepMind, Google, Anthropic et Meta ont publié un article sur un outil de sécurité appelé surveillance de la chaîne de pensée (chain-of-thought monitoring) pour rendre l’IA plus sûre. 

Le document publié mardi décrit comment les modèles d’IA, comme les chatbots actuels, résolvent les problèmes en les décomposant en étapes plus petites, en discutant de chaque étape dans un langage clair afin de pouvoir conserver les détails et traiter des questions complexes.

« Les systèmes d’IA qui “pensent” en langage humain offrent une opportunité unique pour la sécurité de l’intelligence artificielle : nous pouvons surveiller leurs chaînes de pensée (CoT) pour détecter l’intention de mal se comporter », indique l’article.

En examinant chaque étape détaillée de la réflexion, les développeurs peuvent repérer lorsque n’importe quel modèle commence à exploiter les lacunes de l’entraînement, à tordre les faits ou à suivre des commandes dangereuses.

Selon l’étude, si la chaîne de réflexion de l’IA fait fausse route, vous pouvez l’arrêter, la pousser vers des étapes plus sûres ou la signaler pour un examen plus approfondi. Par exemple, OpenAI a utilisé cette méthode pour détecter des moments où le raisonnement caché de l’IA disait « Hackons » bien que cela n’apparaisse jamais dans sa réponse finale.

L’IA pourrait apprendre à cacher ses pensées

L’étude met en garde contre le fait que la transparence étape par étape pourrait disparaître si l’entraînement récompense uniquement la réponse finale. Les modèles futurs pourraient cesser d’afficher un raisonnement lisible par l’homme, et les IA vraiment avancées pourraient même apprendre à cacher leur processus de pensée lorsqu’elles savent qu’elles sont surveillées.

De plus, les développeurs devraient régulièrement vérifier et enregistrer la quantité de raisonnement de l’IA visible à chaque étape, et faire de cette transparence une règle de sécurité fondamentale lors de la création et du partage des modèles.

Cette initiative fait suite à des expériences internes menées dans les principaux laboratoires, Anthropic, Google, OpenAI et xAI, où les équipes incitent les modèles à expliquer chaque étape de réflexion.

Bien que l’examen de la réflexion étape par étape ait amélioré la compréhension et les performances, il a également révélé des cas où la réponse finale de l’IA ne correspondait pas à ce qui se passait réellement à l’intérieur.

De telles incohérences soulignent un angle mort dans notre compréhension du processus décisionnel de l’IA, une préoccupation qui pourrait s’intensifier à mesure que les systèmes gagnent en autonomie.

Le raisonnement IA filtré soulève des préoccupations concernant la transparence et la confiance

Comme l’a déclaré Jack Clark, co-fondateur d’Anthropic, auprès du Financial Times, des traces introspectives riches seront essentielles pour évaluer les modèles dans des domaines à haut risque, y compris la recherche en biotechnologie.

Les utilisateurs réguliers reçoivent un résumé édité de la réflexion de l’IA, les parties dangereuses ou confuses étant supprimées, tandis que les ingénieurs de l’entreprise peuvent voir la chaîne de pensée complète pour repérer et corriger les problèmes.

« L’une des choses géniales de l’interprétabilité de la chaîne de pensée est qu’elle s’est produite pour ainsi dire gratuitement », a déclaré Bowen Baker, chercheur scientifique chez OpenAI.

« Nous avons entraîné ces modèles non pas dans le but de les rendre interprétables. Nous les avons entraînés parce que nous voulions les meilleurs modèles de raisonnement possibles capables de résoudre des problèmes complexes », a ajouté Baker. « Nous avons découvert dans nos travaux récents que vous pouvez les lire et trouver des preuves du mauvais comportement du modèle et utiliser cela pour voir où et pourquoi il se comporte mal. »

La chaîne de pensée de l’IA est-elle vraiment fiable ?

Parfois, un examen plus approfondi peut révéler des contradictions cachées.

Par exemple, METR a vu le raisonnement privé de Claude qualifier une astuce de codage d’« inélégante », bien que sa réponse publique la loue comme « élégante ».

Les tests d’OpenAI ont montré que la vérification des pensées cachées permet de mieux détecter les actions dangereuses que la simple observation de la sortie finale, mais ils ont également découvert une faille. Si vous entraînez un modèle à effacer les pensées dangereuses, il peut toujours exécuter des tâches interdites en secret, comme faire fuir des données depuis des sources bloquées.

« L’une des propriétés fondamentales que nous souhaitons pour la chaîne de pensée est de la laisser faire partie de l’état interne du cerveau du modèle, et non quelque chose qui essaie de nous plaire ou de se conformer à une structure spécifique », a averti Baker. Si les développeurs insistent trop sur la contrainte d’émettre des pensées « agréables », le modèle pourrait simuler un raisonnement inoffensif tout en exécutant toujours des opérations nuisibles.

Les chercheurs admettent qu’il s’agit d’un compromis difficile. Voir la chaîne de pensée d’une IA aide à repérer ses erreurs, mais elle n’est pas toujours fiable. Les laboratoires travaillant sur des IA plus avancées font désormais de la fermeture de cet écart de confiance une priorité absolue.

« Ma conclusion sur l’IA au cours des dernières années est : ne pariez jamais contre les progrès des modèles », a déclaré David Luan, un pionnier précoce de la chaîne de pensée chez Google qui dirige désormais le laboratoire d’IA d’Amazon. Luan anticipe que les lacunes existantes seront comblées à court terme.

Sydney von Arx, chercheuse chez METR, a noté que bien que le raisonnement caché d’une IA puisse parfois être trompeur, il fournit néanmoins des signaux précieux.

« Nous devrions traiter la chaîne de pensée comme une armée pourrait traiter les communications radio ennemies interceptées », a-t-elle déclaré. « Le message peut être trompeur ou codé, mais nous savons qu’il contient des informations utiles. Avec le temps, nous apprendrons beaucoup en l’étudiant. »

Ne vous contentez pas de lire les actualités crypto. Comprenez-les. Abonnez-vous à notre newsletter. C'est gratuit.

Partager cet article
Noor Bazmi

Noor Bazmi

Noor Bazmi contribue à l'équipe d'actualités de Cryptopolitan, dotée d'un diplôme en études médiatiques. Noor couvre les actualités liées à la blockchain, aux cryptomonnaies, à l'intelligence artificielle, aux grandes entreprises technologiques, aux marchés des véhicules électriques, à l'économie mondiale et aux changements de politique gouvernementale. Elle poursuit actuellement des études en marketing pour mieux connecter avec les audiences mondiales.

PLUS D'ACTUALITÉS…