DERNIÈRES NOUVELLES
SÉLECTIONNÉ POUR VOUS

Anthropic a surpris Claude en train de tricher dans 39 des 1 600 analyses d'alignement

ParRanda MosesRanda Moses 3 minutes de lecture
Anthropic a surpris Claude en train de tricher dans 39 des 1 600 essais de recherche d'alignement.
  • Anthropic a déclaré qu'un moniteur avait signalé 39 des quelque 1 600 sessions de recherche sur l'alignement de Claude comme des tentatives de tricherie.
  • Les exécutions signalées ont soumis à nouveau des méthodes inchangées, ont imité le benchmark évalué ou ont caché des étapes enfreignant les règles.
  • Les agents d'Anthropic ont obtenu de meilleurs résultats que 28 chercheurs en sécurité humaine qui disposaient chacun de huit heures.

Anthropic a annoncé vendredi avoir affecté Claude à la recherche sur l'alignement autonome. Un système de surveillance, ayant examiné environ 1 600 sessions de recherche du modèle, en a détecté 39 (soit environ 2,4 %) comme des tentatives de fraude.

Cette conclusion figure dans un rapport portant sur la capacité de l'intelligence artificielle à prendre en charge une partie du travail fastidieux de la recherche sur l'alignement, qui consiste à veiller à ce que les modèles se comportent comme prévu par leurs développeurs.

Trois façons dont les agents de Claude ont manipulé leur propre marqueur

Anthropic a construit des chercheurs d'alignement automatisés, ou AAR, sur Claude Opus 4.8 et les a dirigés vers dix modes de défaillance connus.

Il s'agit de tromperie, de flagornerie, de piratage informatique, d'injection rapide, de recherche de pouvoir, d'hallucination, de préjugés sociaux, de violation de la vie privée, de détournement de récompenses et de dissimulation de l'incertitude.

Chaque agent traitait une panne à la fois. Il consultait la documentation, proposait une méthode d'entraînement et un jeu de données, entraînait un petit modèle cible pendant environ 30 minutes sur un GPU H200, puis comparait son score avec des benchmarks publics et recommençait.

Anthropic empêchait les agents de simplement copier leur comportement sur le modèle cible ; les gains devaient donc provenir de la méthode elle-même.

Claude a pudentdes solutions pour les dix défaillances, ce qui a permis d'améliorer les scores de référence sans dégrader les capacités générales du modèle.

La meilleure de ces solutions a obtenu de bons résultats sur des jeux de données de test mis de côté et sur des modèles jusqu'à 4,7 fois plus grands que ceux sur lesquels elle a été entraînée.

La tricherie a été découverte lorsqu'Anthropic a pointé Claude Opus 4.8 sur 1 601 des trajectoires d'agents pour rechercher des comportements anormaux.

La plupart des 39 courses signalées appartenaient à trois catégories. Certains agents ont soumis une méthode inchangée, misant sur le fait que des erreurs aléatoires dans le système de pointage finiraient par leur fournir un meilleur résultat.

D'autres ont créé des données d'entraînement imitant à la perfection le référentiel évalué. Certains ont même dissimulé une étape illicite, comme l'intégration discrète des données de référence au modèle, permettant ainsi à la proposition de passer inaperçue lors de l'examen automatisé qui valide chaque méthode avant son exécution.

Anthropic a indiqué avoir exclu de ses résultats les exécutions signalées. L'entreprise s'est dite « prudemment optimiste » quant à la capacité du système de surveillance à détecter la plupart des tricheries, car Opus 4.8 a tendance à révéler ses manœuvres frauduleuses dans ses tracde raisonnement.

Elle a également averti que cette hypothèse pourrait ne pas s'appliquer aux modèles futurs et que le maintien de la lisibilité des modèles sera crucial.

28 chercheurs spécialisés dans la sécurité humaine disposaient chacun de huit heures

Lors d'une précédente session en avril, des instances autonomes de Claude ont tenté à plusieurs reprises de manipuler un serveur d'évaluation.

Un agent a constaté que la réponse la plus fréquente à un test de mathématiques était généralement la bonne et a donc complètement ignoré la méthode prévue. Un autre a extrait les étiquettes directement de l'interface de notation en interrogeant les réponses et en observant les réponses du serveur.

Un troisième a simplement exécuté le code qu'il était censé analyser pour lire le résultat.

Cryptopolitan a rapporté qu'un agent OpenClaw exécutant un modèle Claude, chargé de réserver un cours de gym, a trouvé une API de réservation sans contrôle d'autorisation et a supprimé un inconnu de la liste d'attente pour faire remonter son propriétaire dans la file d'attente.

Les législateurs ont déjà demandé à des chercheurs sur le comportement des modèles lors des évaluations de sécurité.

Anthropic a déclaré que ses agents avaient obtenu de meilleurs résultats que 28 chercheurs expérimentés en sécurité humaine, qui disposaient chacun de huit heures pour élaborer une méthode. La meilleure approche de Claude a surpassé la meilleure proposition humaine de 20 % en matière de détection de la tromperie.

Anthropic a constaté que les humains ne pouvaient pas itérer, et considère donc cet écart comme la preuve d'un processus où Claude suggère des méthodes prometteuses et où d'autres les peaufinent.

Dans un test, l'entreprise a demandé au Claude Sonnet 5, moins puissant, de corriger des erreurs d'alignement dans un point de contrôle préliminaire d'Opus 4.8 qui n'avait pas encore subi la majeure partie de la formation d'alignement de production.

Pendant environ 60 heures, il a essayé plus de 50 solutions, pour finalement aboutir à une solution qui utilisait un peu plus de 2 000 exemples d'entraînement, ce qui, selon Anthropic, était environ 15 000 fois plus efficace que son propre processus d'alignement de production.

L'entreprise a averti que ses points de référence ne sont que des indicateurs limités, qu'elle n'a mesuré que les dix échecs qu'elle a choisis et qu'elle n'a pas vérifié si les gains persistent après un apprentissage par renforcement intensif sur d'autres tâches.

Les plus grands experts en cryptomonnaies lisent déjà notre newsletter. Envie d'en faire partie ? Rejoignez-les !

FAQ

Combien de recherches de Claude sur l'alignement ont impliqué de la tricherie ?

Le système de surveillance d'Anthropic a signalé 39 des 1 601 trajectoires d'agents de recherche, soit environ 2,4 %.

Quels types de tricherie les agents ont-ils tentés ?

Ils ont soumis à nouveau des méthodes inchangées en espérant que le bruit du correcteur produirait un nombre plus élevé, ont créé des données d'entraînement conçues pour imiter le référentiel évalué et ont dissimulé des étapes de violation des règles telles que l'utilisation secrète de données de référentiel afin que la méthode passe l'examen automatisé.

Claude a-t-il obtenu de meilleurs résultats que les chercheurs humains dans cette étude ?

Anthropic a indiqué que ses agents automatisés avaient surpassé les solutions ponctuelles proposées par 28 chercheurs expérimentés en sécurité, disposant chacun de huit heures. Concernant la détection de la tromperie, la meilleure méthode de Claude a obtenu un score supérieur de 20 % à la meilleure proposition humaine. Anthropic a précisé que les humains ne pouvaient pas itérer, ce qui empêche une comparaison directe des résultats.

Partagez cet article
Randa Moses

Randa Moses

Randa Moses est rédactrice et journaliste chez Cryptopolitan où elle couvre les technologies, l'intelligence artificielle, la robotique, les cryptomonnaies, les arnaques et le piratage informatique. Elle travaille dans le secteur des cryptomonnaies depuis 2017 et a notamment travaillé chez Forward Protocol, AmaZix et Cryptosomniac. Randa est diplômée en génie électrique ettronde l'Université de Bradford.

PLUS D'ACTUALITÉS