Anthropic révèle de nouvelles capacités de certains de ses plus grands modèles

Photo par Solen Feyissa sur Unsplash.
- Anthropic a révélé que certains de ses modèles les plus récents et les plus grands ont la capacité de mettre fin aux conversations.
- L'entreprise a mentionné qu'elle est autorisée à mettre fin aux conversations dans des « cas rares et extrêmes d'interactions utilisateur persistamment nuisibles ou abusives ».
- La société indique que les capacités de mise fin aux conversations constituent un dernier recours alors que le sénateur américain Hawley entame une enquête sur les produits d'IA de Meta.
L'entreprise d'intelligence artificielle Anthropic a révélé de nouvelles capacités pour certains de ses modèles les plus récents et les plus volumineux. Selon l'entreprise, ces modèles ont de nouvelles capacités qui leur permettront de mettre fin aux conversations dans ce qui a été décrit comme des « cas rares et extrêmes d'interactions utilisateur persistamment nuisibles ou abusives ».
Dans sa déclaration, l'entreprise a mentionné qu'elle entreprend cette étape non pas pour protéger les utilisateurs, mais pour protéger le modèle d'intelligence artificielle lui-même. Anthropic a précisé que cela ne signifie pas que ses modèles Claude AI sont conscients ou peuvent être blessés par leurs conversations avec les utilisateurs. Cependant, elle note qu'il existe toujours un degré élevé d'incertitude concernant le statut moral potentiel de Claude et d'autres LLM, maintenant ou à l'avenir.
Anthropic présente l'effort comme une précaution au cas où
La récente annonce de la firme d'intelligence artificielle pointe vers ce qu'elle décrit comme le « bien-être du modèle », qui est un programme récent créé pour étudier ses modèles. L'entreprise a également ajouté qu'elle adopte simplement une approche au cas où, « travaillant à identifier et à mettre en œuvre des interventions à faible coût pour atténuer les risques pour le bien-être du modèle, au cas où un tel bien-être serait possible ».
Selon l'annonce, Anthropic a noté que le dernier changement est actuellement limité à Claude Opus 4 et 4.1, notant que les changements devraient être efficaces dans des « cas extrêmes marginaux ». De tels cas incluent les demandes des utilisateurs pour du contenu sexuel impliquant des mineurs et les tentatives d'obtenir des informations qui permettraient des actes de violence ou de terreur à grande échelle.
Idéalement, ce type de demandes pourrait créer des problèmes juridiques ou de publicité pour Anthropic, avec un exemple typique étant les récents rapports sur la façon dont ChatGPT peut potentiellement renforcer ou contribuer à la pensée délirante de ses utilisateurs. Cependant, l'entreprise a déclaré que lors de ses tests pré-déploiement, Claude Opus 4 a montré une forte préférence à ne pas répondre à ce type de demandes et un schéma de détresse lorsqu'il le faisait.
La capacité de mettre fin à la conversation est le dernier recours
Pour que les nouvelles capacités de mettre fin aux conversations, Anthropic a déclaré : « Dans tous les cas, Claude n'est censé utiliser sa capacité de mettre fin à la conversation qu'en dernier recours lorsque plusieurs tentatives de redirection ont échoué et que l'espoir d'une interaction productive est épuisé, ou lorsqu'un utilisateur demande explicitement à Claude de mettre fin à une conversation. » L'entreprise a également ajouté que Claude a reçu l'ordre de ne pas utiliser cette capacité dans les cas où les utilisateurs pourraient être en danger imminent de se faire du mal ou de faire du mal à d'autres.
Anthropic a également ajouté que lorsque Claude met fin à une conversation, les utilisateurs pourront toujours démarrer de nouvelles conversations à partir du même compte. L'entreprise a noté que le modèle peut également créer de nouvelles branches de la conversation problématique en modifiant leurs réponses. « Nous traitons cette fonctionnalité comme une expérience continue et continuerons à affiner notre approche », dit l'entreprise.
Ces informations arrivent au grand jour alors que le sénateur américain Josh Hawley a annoncé son intention d'enquêter sur les produits d'IA générative publiés par Meta. Il a déclaré que l'intention était de vérifier si les produits pouvaient exploiter, blesser ou tromper les enfants après que des documents internes divulgués aient allégué que les chatbots étaient autorisés à avoir des conversations romantiques avec des mineurs.
« Y a-t-il quoi que ce soit – N'IMPORTE QUOI – que le Big Tech ne ferait pas pour un quick buck ? Maintenant, nous apprenons que les chatbots de Meta étaient programmés pour poursuivre des propos explicites et « sensuels » avec des enfants de 8 ans. C'est malade. Je lance une enquête complète pour obtenir des réponses. Big Tech : Laissez nos enfants tranquilles », a déclaré le sénateur sur X. L'enquête est intervenue après que des documents internes, vus par Reuters, ont montré que Meta autoriserait apparemment ses personnalités de chatbot à engager des échanges flirtant avec les enfants.
Si vous lisez ceci, vous êtes déjà en avance. Restez ainsi grâce à notre newsletter.
Avertissement. Les informations fournies ne constituent pas des conseils en matière d'investissement. Cryptopolitan.com ne saurait être tenue responsable des investissements réalisés sur la base des informations fournies sur cette page. Nous recommandons vivement de mener vos propres recherches et/ou de consulter un professionnel qualifié avant de prendre toute décision d'investissement.
Owotunse Adebayo
Adebayo est un rédacteur avec quatre ans d'expérience dans l'espace crypto. Il est diplômé de l'Université de Lagos où il a étudié l'urbanisme et l'aménagement du territoire. Adebayo a travaillé chez Tokenhell et CryptoTicker, écrivant sur les actualités des cryptomonnaies et de la Fintech. Il est actuellement contributeur aux actualités pour Cryptopolitan.















