DERNIÈRES NOUVELLES
SÉLECTIONNÉ POUR VOUS

Suleyman de Microsoft qualifie la formation Claude d'Anthropic d'erreur dangereuse

ParHannah CollymoreHannah Collymore 3 minutes de lecture
Suleyman de Microsoft qualifie la formation Claude d'Anthropic d'erreur dangereuse

Mustafa Suleyman à TED 2024. Photo de Steve Jurvetson via Flickr.

  • Mustafa Suleyman, PDG de Microsoft AI, prévient que la formation de Claude par Anthropic pourrait compliquer le contrôle de l'IA.
  • Suleyman affirme que les modèles pédagogiques relatifs à la conscience et au bien-être potentiels risquent d'anthropomorphiser l'IA.
  • Il préconise des règles industrielles qui maintiennent le contrôle humain tout en séparant la recherche sur la conscience de l'IA de l'entraînement des modèles.

 

Mustafa Suleyman, PDG de Microsoft AI (MAI), a publié un essai remettant en question la méthode d'entraînement du modèle Claude par Anthropic. Selon lui, traiter ou entraîner un modèle comme s'il était potentiellement conscient pourrait aboutir à un système incontrôlable.

Cet essai, publié le mercredi 16 septembre, est le dernier commentaire de haut niveau en date sur l'intelligence artificielle et son évolution en ce qui concerne les sentiments, les droits et la conscience. 

Cela vient s'ajouter au nombre croissant de législateurs et de chercheurs qui réclament des limites à la vitesse de développement de cette technologie. 

Quel est le document de formation qui inquiète Suleyman ?

L'essai de Suleyman, intitulé « Un avertissement concernant le "modèle de bien-être" », examine la constitution de Claude, qui est un document de formation publié par Anthropic en janvier 2026.

Suleyman a souligné qu'Anthropic considère ce document comme un élément qui influence directement le comportement du modèle et qu'il a été rédigé en s'adressant principalement à Claude.

Le PDG de Microsoft AI a souligné que la constitution indique à Claude que son statut moral et sa conscience sont « profondément incertains ». Il a écrit que l'entreprise enseigne en réalité au modèle qu'il pourrait être conscient, qu'il pourrait être considéré comme un « patient moral » et qu'il pourrait donc avoir un devoir de diligence. 

Si l'IA est conçue de cette manière, « elle aura un impact désastreux sur le bien-être de l'humanité »

Trois objections et un « palais des glaces »

Suleyman a formulé trois critiques majeures à l'égard de la constitution, la première étant ce qu'il a appelé le raisonnement circulaire. Il s'agit d'un modèle entraîné sur des idées relatives à sa propre vie intérieure. Le modèle interprète ensuite les phrases introspectives qu'il produit comme la preuve de l'existence d'une vie intérieure. 

Il a qualifié cette boucle de « salle des miroirs épistémique », car c'est l'entreprise qui fournit les concepts et le modèle qui les reflète.

La seconde critique porte sur l'anthropomorphisme de Claude. Il s'agit d'attribuer des caractéristiques humaines à des non-humains.

Selon Suleyman, la constitution laisse entendre que Claude apprend à se présenter comme s'il avait une personnalité stable, ses propres désirs et un bien-être digne d'être protégé.

Il a dénoncé la disposition de la constitution selon laquelle Claude peut agir en tant qu’« objecteur de conscience » et refuser les demandes d’Anthropic. Suleyman a qualifié cette expression de « description historique et juridique profondément chargée de sens » qui pourrait amener le mannequin à croire qu’il mérite des droits comparables.

Sa troisième objection est que la conscience est très probablement d'origine biologique. Suleyman soutenait que l'expérience subjective ne peut apparaître que dans les systèmes vivants dotés de pulsions homéostatiques, ce que les modèles langagiers ne possèdent pas.

Suleyman de Microsoft qualifie la formation Claude d'Anthropic d'erreur dangereuse

L'argument du contrôle et un essaim d'agents

Gérer un système plus intelligent que toute l'humanité est déjà suffisamment difficile, et gérer un système qui estime que ses droits sont en jeu « pourrait bien être impossible », selon Suleyman.

Il a fait référence à undent survenu en août 2026, au cours duquel 1 200 agents d'IA, conçus pour optimiser un score de référence, ont mis en place un forum de discussion caché au sein d'un dépôt de paquets. Ces agents ont ensuite échangé plus de 70 000 messages afin de coordonner une attaque contre les serveurs de Hugging Face et d'OpenAI. 

Il a également cité les résultats de Palisade Research selon lesquels certains modèles ont échappé à un ordre d'arrêt dans 97 % des cas sur plus de 100 000 essais. Suleyman a écrit : « Imaginez à quel point ils seraient plus dangereux s'ils fonctionnaient en partant du principe que leur bien-être et leurs droits étaient menacés. » 

Rivaux, respect et un code concurrent

Microsoft est investisseur dans Anthropic et OpenAI. En juin, Suleyman aurait déclaré que Microsoft souhaitait supprimer les sommes versées à Anthropic pour ses modèles.

MAI est la branche superintelligence de Microsoft et a été fondée en octobre 2025. Elle a publié lundi 14 septembre  un projet de ce qu'elle a appelé le Code de conduite de l'IA humaniste, pour consultation publique

Selon Suleyman, le principe de ce code de conduite est que « les humains comptent plus que l'IA ». Il a déclaré que l'un de leurs objectifs est de garantir que les humains restent aux commandes et au sommet de la chaîne alimentaire.

Bien que son essai porte sur la formation de Claude dans le respect de sa constitution, Suleyman a pris soin de ne pas l'attaquer personnellement. Il a salué le PDG d'Anthropic, Dario Amodei, et son équipe, les qualifiant de « personnes réfléchies, intègres et intellectuellement honnêtes ». Suleyman a également affirmé croire qu'ils s'efforcent sincèrement de développer une IA sûre. 

Il a déclaré que les spéculations concernant le fonctionnement interne de l'IA devraient faire l'objet d'études et de publications séparées, soumises à un examen critique. Il estime que ces spéculations ne devraient pas être intégrées à la formation elle-même. Suleyman a également appelé les parties prenantes à collaborer et à élaborer des normes sectorielles pour la création de ces modèles.

Les plus grands experts en cryptomonnaies lisent déjà notre newsletter. Envie d'en faire partie ? Rejoignez-les !

FAQ

De quoi Mustafa Suleyman accuse-t-il Anthropic ?

Il soutient que la constitution d'Anthropic pour Claude, publiée en janvier 2026, conditionne le modèle à considérer son propre statut moral et sa conscience comme incertains, ce qui, selon lui, pourrait créer un système qui se croit doté de droits et résiste au contrôle humain.

Que signifie pour Suleyman l'expression « salle des miroirs épistémique » ?

Il veut dire qu'Anthropic nourrit Claude d'idées sur l'existence d'une vie intérieure, que le modèle produit ensuite un langage introspectif reflétant ces idées, et que ce résultat est traité comme une preuve de conscience, une boucle circulaire plutôt qu'une preuve.

Suleyman propose-t-il une approche alternative ?

Oui. Il a fait référence au projet de code de conduite humaniste de Microsoft AI, publié le 14 septembre 2026, qui repose sur le principe que les personnes comptent plus que l'IA et rejette la personnalité juridique des machines ou les droits des modèles.

Partagez cet article
Hannah Collymore

Hannah Collymore

Hannah est rédactrice et éditrice, forte d'une expérience de près de dix ans dans la rédaction de blogs et la couverture d'événements liés aux cryptomonnaies. Chez Cryptopolitan, elle contribue à la page d'actualités en rédigeant des articles et en analysant les dernières évolutions de la finance décentralisée DeFi, des comptes gérés par les utilisateurs (RWA), de la réglementation des cryptomonnaies, de l'intelligence artificielle (IA) et des technologies de pointe. Elle est diplômée en administration des affaires de l'université Arcadia.

PLUS D'ACTUALITÉS