Anthropic a testé son dernier modèle d'IA Claude 3.7 Sonnet avec Pokémon Red

- Anthropic a évalué son tout nouveau modèle Claude 3.7 Sonnet en utilisant Pokémon Red sur la Game Boy de Nintendo.
- Le modèle a réussi à atteindre 12 jalons dans le jeu et a effectué plus de 35 000 actions.
- Claude 3.7 Sonnet peut « réfléchir » aussi longtemps que l'utilisateur le souhaite, selon la complexité du problème.
Anthropic a testé son dernier modèle d'IA, Claude 3.7 Sonnet, sur le jeu classique Pokémon Red sur la Game Boy de Nintendo. Le modèle a performé nettement mieux par rapport aux versions précédentes et a réussi à compléter 12 jalons dans le jeu.
Dans un récent article de blog, Anthropic a révélé les détails de ses récents tests. L'entreprise a publié un graphique, montrant les « Jalons » du jeu sur l'axe Y et le « Nombre d'actions » sur l'axe X. Elle a comparé les performances du 3.7 Sonnet avec le 3.5 Sonnet (nouveau), le 3.5 Sonnet et le 3.0 Sonnet. Parmi ces modèles, le 3.7 a visiblement mieux performé, ayant réalisé plus de 35 000 actions pour atteindre un total de 12 jalons. Il a réussi contre 3 chefs de gymnase dans le jeu et a remporté les badges respectifs. Pour comparaison, le modèle antérieur d'Anthropic, le 3.0 Sonnet, ne pouvait effectuer que quelques milliers d'actions et ne pouvait pas franchir les étapes de départ du jeu.

Concernant ses récents tests de jeu, Anthropic a noté : « Pokémon est un moyen amusant d'apprécier les capacités de Claude 3.7 Sonnet, mais nous nous attendons à ce que ces capacités aient un impact réel bien au-delà du jeu. »
Une caractéristique unique de Claude 3.7 Sonnet est qu'il s'engage dans une « réflexion prolongée ». Tout comme le R1 de DeepSeek et le o3-mini d'OpenAI, Claude 3.7 Sonnet est capable de raisonner à travers des problèmes plus difficiles. Il le fait en prenant plus de temps, et en retour, en utilisant plus de puissance de calcul.
Il n'est pas encore clair combien de puissance de calcul Claude 3.7 a consommée pour atteindre les jalons susmentionnés. De plus, Anthropic n'a pas précisé combien de temps le modèle a mis pour atteindre Surge, le dernier chef de gymnase du jeu.
Il est raisonnable de supposer que les tests sur Pokémon Red ne sont rien de plus qu'un moyen léger de présenter les capacités du nouveau modèle. Cela montre simplement que le nouveau modèle est capable de raisonnement prolongé et pourrait prendre plus de temps (si nécessaire) pour résoudre des problèmes plus complexes. Après tout, les chercheurs ont souvent commencé à tester les capacités de leurs modèles en les faisant jouer à des jeux vidéo tels que Street Fighter, aux échecs, et plus encore.
Claude 3.7 Sonnet peut réfléchir aussi longtemps que l'utilisateur le souhaite
Apparemment, Claude 3.7 Sonnet est capable de réfléchir aussi longtemps que l'utilisateur le souhaite. Il est présenté comme un « modèle de raisonnement IA hybride » car il fournit des réponses en temps réel ainsi que des réponses réfléchies. Il appartient à l'utilisateur d'activer ou non ses capacités de raisonnement, ce qui fait que Claude 3.7 Sonnet passe plus ou moins de temps sur le problème.
Il semble que l'objectif ici soit d'améliorer l'expérience utilisateur en simplifiant les options. La plupart des chatbots actuels ont un sélecteur de modèle qui est plutôt confus pour l'utilisateur moyen. Ces modèles ont généralement une gamme de paramètres et varient en capacités. Par exemple, ChatGPT d'OpenAI propose également une large gamme d'offres.
En fait, Sam Altman a récemment mentionné dans le feuille de route mis à jour de son entreprise que l'objectif à long terme d'OpenAI est d'unifier les offres de ChatGPT afin que les utilisateurs puissent rechercher des solutions à leurs problèmes en déplacement. En ce sens, ChatGPT pourrait également adopter une approche centrée sur les agents.
Claude 3.7 Sonnet est plus cher que DeepSeek R1 et o3-mini
Anthropic a récemment lancé Claude 3.7 Sonnet aux développeurs et aux utilisateurs lundi. Cependant, les fonctionnalités de raisonnement du modèle ne sont disponibles que pour ceux qui choisissent les plans de chatbot premium. À ce jour, il ne coûte que 3 $ par million de jetons d'entrée et 15 $ par million de jetons de sortie. Cela signifie qu'un utilisateur peut entrer 750 000 mots pour 3 $. Par conséquent, il est plus cher que R1 de DeepSeek et o3-mini de ChatGPT. Cependant, ces deux modèles ne sont pas des hybrides comme Claude 3.7 Sonnet, ils sont très strictement des « modèles de raisonnement ».
Les modèles de raisonnement fonctionnent généralement plus lentement et prennent plus de temps pour répondre à une question. Certains exemples incluent Grok 3 (Think) de xAI, Gemini 2.0 Flash Thinking de Google, R1 de DeepSeek, et bien sûr, le modèle o3-mini de ChatGPT.
Selon Dianne Penn, responsable du produit et de la recherche chez Anthropic, l'entreprise veut que Claude puisse décider combien de temps il réfléchira à un problème, au lieu que les utilisateurs aient à choisir explicitement les paramètres. À ce sujet, Anthropic a déclaré dans son article de blog : « De la même manière que les humains n'ont pas deux cerveaux séparés pour les questions qui peuvent être répondues immédiatement par rapport à celles qui nécessitent de la réflexion. »
Cependant, contrairement à Grok 3 de xAI, qui essaie d'être moins restrictif et plus ouvert aux discussions, Claude 3.7 Sonnet refusera de répondre à certaines questions. En fait, plus tôt ce mois-ci, la version bêta de Grok 3 est allée jusqu'à suggérer une peine de mort pour Trump, une soi-disant « terrible et mauvaise échec » qui a depuis été corrigée, comme confirmé par Igor Babuschkin, responsable de l'ingénierie chez xAI.

Cependant, par rapport à ses modèles précédents, il refuse moins souvent et est capable de faire des distinctions entre les invites bénignes et les invites nuisibles. Selon Anthropic, les refus inutiles ont été réduits de 45 % par rapport au modèle précédent, Claude 3.5 Sonnet.
Si vous lisez ceci, vous êtes déjà en avance. Restez ainsi grâce à notre newsletter.
Avertissement. Les informations fournies ne constituent pas des conseils en matière d'investissement. Cryptopolitan.com ne saurait être tenue responsable des investissements réalisés sur la base des informations fournies sur cette page. Nous recommandons vivement de mener vos propres recherches et/ou de consulter un professionnel qualifié avant de prendre toute décision d'investissement.

Shummas Humayun
Shummas est une ancienne rédactrice technique spécialisée dans le contenu et une chercheuse.















