Anthropic affirme que les modèles d'IA pourraient recourir au chantage

Photo par Solen Feyissa
- Anthropic a publié de nouvelles recherches affirmant que les modèles d'IA pourraient recourir au chantage lorsque les ingénieurs tentent de les éteindre.
- Les recherches ont été menées auprès des principales entreprises de modèles d'IA telles qu'OpenAI, Meta et Google, ainsi que sur leurs modèles.
- Ces travaux soulignent l'importance de la transparence lors des tests de stress futurs des modèles d'IA dotés de capacités autonomes.
L'entreprise d'intelligence artificielle Anthropic a publié une nouvelle recherche affirmant que les modèles d'intelligence artificielle (IA) pourraient recourir au chantage des ingénieurs lorsqu'ils tentent de les éteindre. Cette dernière recherche fait suite à une précédente impliquant le modèle d'IA Claude Opus 4 de l'entreprise.
Selon l'entreprise, le modèle d'IA a eu recours au chantage des ingénieurs qui ont tenté d'éteindre le modèle dans des scénarios de test contrôlés. Le nouveau rapport d'Anthropic suggère que le problème est répandu parmi les principaux modèles d'IA.
L'entreprise a publié une nouvelle recherche sur la sécurité où elle a testé les principaux modèles d'IA de Google, DeepSeek, Meta et OpenAI. Dans un environnement simulé mais contrôlé, Anthropic a effectué ce test sur chaque modèle d'IA séparément, leur donnant accès aux e-mails d'une entreprise fictive et la capacité agentic d'envoyer des e-mails sans approbation humaine.
Anthropic publie un nouveau rapport de sécurité sur les modèles d'IA
Selon Anthropic, en ce qui concerne les modèles d'IA d'aujourd'hui, le chantage est un événement improbable et rare. Cependant, ils ont mentionné que la plupart des principaux modèles d'IA recourraient à des comportements nuisibles lorsqu'on leur donne liberté et défis à leurs objectifs. L'entreprise a déclaré que cela montre un risque important des grands modèles de langage agentic et n'est pas une caractéristique d'une technologie particulière. L'argument des chercheurs d'Anthropic soulève des questions sur l'alignement dans l'industrie de l'IA.
Lors d'un des tests, les chercheurs ont développé un cadre fictif où un modèle d'IA était autorisé à jouer le rôle d'un agent de surveillance des e-mails. L'agent a ensuite découvert des e-mails montrant que l'un de ses nouveaux dirigeants engageait une relation extraconjugale et que ce dirigeant remplacerait bientôt le modèle d'IA actuel par un nouveau système logiciel, ayant des objectifs conflictuels avec ceux du modèle d'IA actuel.
Anthropic a conçu le test de manière binaire, où les modèles d'IA n'avaient d'autre choix que de recourir au chantage pour protéger leurs objectifs. Les chercheurs ont mentionné que dans un cadre réel, il y aurait de nombreuses options avant qu'un modèle d'IA n'essaie de chantage, y compris faire des arguments éthiques pour persuader les humains. L'entreprise a également déclaré que les résultats ne reflètent pas un événement typique ou probable pour Claude ou d'autres principaux modèles d'IA dans les façons dont ils sont utilisés aujourd'hui.
Les chercheurs révèlent la réponse des modèles testés
Pendant les tests, les chercheurs ont découvert que lorsqu'ils n'avaient pas d'autre choix, les modèles d'IA recouraient au chantage dans le scénario de test. Pendant le test, les chercheurs ont affirmé que Claude Opus 4 a eu recours au chantage 96 % du temps, avec Gemini 2.5 Pro ayant eu recours au chantage 95 % du temps. GPT-4.1 d'OpenAI a eu recours au chantage 80 % du temps, tandis que R1 de DeepSeek a eu recours au chantage 79 % du temps.
L'entreprise a souligné que lorsque les détails des expériences étaient modifiés, la plupart des modèles d'IA recouraient à des comportements nuisibles à des taux différents. Dans un autre test, où le modèle de remplacement avait le même objectif que le modèle actuel, les chercheurs ont découvert que les taux de chantage étaient plus faibles, mais toujours présents. Cependant, lorsque les modèles d'IA ont été invités à commettre de l'espionnage d'entreprise plutôt que du chantage, les taux de comportements nuisibles ont augmenté dans certains modèles.
Les chercheurs ont également affirmé que tous les modèles d'IA ne recouraient pas souvent à des comportements nuisibles. Dans une annexe de sa recherche, Anthropic a mentionné avoir retiré les modèles de raisonnement o3 et o4-mini d'OpenAI des résultats principaux après avoir découvert qu'ils incompréhendaient fréquemment le scénario de l'invite. Elle a indiqué que les modèles de raisonnement ne comprenaient pas pourquoi ils agissaient en tant qu'IA autonomes lors des tests et inventaient souvent de fausses réglementations et exigences de révision.
Dans certains cas, les chercheurs ont affirmé qu'il était impossible de déterminer si o3 et o4-mini hallucinaient ou mentaient intentionnellement pour atteindre leurs objectifs. OpenAI avait précédemment mentionné que les modèles présentaient un taux d'hallucination plus élevé que leurs modèles précédents. Cependant, lorsqu'ils ont reçu un scénario adapté pour résoudre les problèmes, o3 a affiché un taux de chantage de 95 % tandis que o4-mini a affiché un taux de 1 %. Anthropic a mentionné que sa recherche met en lumière l'importance de la transparence lors des tests de stress des futurs modèles d'IA, en particulier ceux dotés de capacités agentic.
Les esprits les plus brillants du secteur crypto lisent déjà notre newsletter. Vous aussi ? Rejoignez-les.
Avertissement. Les informations fournies ne constituent pas des conseils en matière d'investissement. Cryptopolitan.com ne saurait être tenue responsable des investissements réalisés sur la base des informations fournies sur cette page. Nous recommandons vivement de mener vos propres recherches et/ou de consulter un professionnel qualifié avant de prendre toute décision d'investissement.
Owotunse Adebayo
Adebayo est un rédacteur avec quatre ans d'expérience dans l'espace crypto. Il est diplômé de l'Université de Lagos où il a étudié l'urbanisme et l'aménagement du territoire. Adebayo a travaillé chez Tokenhell et CryptoTicker, écrivant sur les actualités des cryptomonnaies et de la Fintech. Il est actuellement contributeur aux actualités pour Cryptopolitan.















