DERNIÈRES ACTUALITÉS
SÉLECTIONNÉ POUR VOUS

Le Qwen3 d’Alibaba déloge le R1 de DeepSeek, maintenant leader des modèles d’IA open-source

ParFlorence MuchaiFlorence Muchai 3 min de lecture
  • La famille de modèles d'IA Qwen3 d'Alibaba a dépassé le R1 de DeepSeek pour devenir le meilleur modèle open source au monde dans des domaines tels que l'instruction linguistique, les mathématiques, la programmation et l'analyse de données. 
  • Qwen3 est peu coûteux à utiliser car il ne coûte que 0,55 $ par million de tokens pour s'exécuter.
  • Les constructeurs américains de puces Nvidia et Intel ont commencé à soutenir Qwen3.

La nouvelle famille de modèles d’IA Qwen3 d’Alibaba a surpassé le R1 de DeepSeek pour devenir le meilleur modèle open-source au monde. Selon les rapports, Qwen3 a mieux performé que R1 dans des tests mesurant les capacités des modèles d’IA open-source dans des domaines tels que l’instruction linguistique, les mathématiques, la programmation et l’analyse de données. 

La famille Qwen3 a été lancée la semaine dernière par l’unité de calcul en nuage d’Alibaba. Elle comprend huit modèles améliorés avec entre 600 millions et 235 milliards de paramètres. En apprentissage automatique, les paramètres sont les variables d’un système d’IA pendant son entraînement.

Selon LiveBench plateforme, une plateforme indépendante qui teste les grands modèles de langage, avant ces nouveaux tests, le R1 de DeepSeek avait été le meilleur modèle d’IA open-source au monde depuis sa sortie en janvier. Mais ce n’est plus le cas.

Les entreprises américaines et chinoises se précipitent pour adopter Qwen 3

La montée du Qwen3 dans les classements LiveBench montre à quelle vitesse l’IA se développe en Chine. L’industrie technologique chinoise a beaucoup grandi grâce aux outils open-source. La méthode open-source d’Alibaba a permis à d’autres développeurs de logiciels tiers de partager la conception, de corriger les liens brisés ou de rendre le programme plus puissant. 

Cependant, les résultats globaux de LiveBench ont montré que Qwen3 n’était pas aussi bon que l’o3 d’OpenAI, le Gemini Pro 2.5 de Google et le Claude 3.7 d’Anthropic, qui sont les meilleurs modèles d’IA fermés au monde. LiveBench indique que l’o3-mini, le modèle d’IA le plus populaire d’OpenAI, était le meilleur au monde dans l’ensemble. Microsoft soutient OpenAI.

Pour chaque 1 million de tokens, il en coûte 10 $ pour exécuter l’o3. D’autre part, Qwen3 est moins cher à utiliser car il ne coûte que 0,55 $ par 1 million de tokens pour s’exécuter. Parce que Qwen3 est moins cher et fonctionne mieux, de nombreuses entreprises ont déclaré qu’elles soutiendraient le tout dernier modèle d’IA d’Alibaba dès sa sortie.

Huawei Technologies, Moore Threads, Cambricon Technologies et Hygon Information Technology sont toutes des entreprises de puces qui ont déclaré qu’elles soutiendraient Qwen3.

Cambricon a déclaré mardi dernier qu’il avait réussi à optimiser Qwen3 pour s’exécuter rapidement sur ses unités de traitement graphique. Cela a été fait parce que les développeurs d’IA aux Philippines voulaient des puces fabriquées en Chine.

Qwen3 est également utilisé sur les services de calcul en nuage de Hyperbolic et Fireworks.ai, deux entreprises d’infrastructure d’IA. Les fabricants de puces américains Nvidia et Intel ont commencé à soutenir Qwen3.

De nombreux grands centres de données en Chine, comme ceux de Pékin, Shanghai, Hangzhou et les provinces du Hubei, du Jilin et du Nord-Ouest du Shaanxi, ont également déclaré qu’ils utiliseraient les modèles d’IA Qwen de troisième génération d’Alibaba. Le réseau de supercalcul en Chine a également adopté Qwen3. Ce réseau relie plus de 20 centres de données dans 20 villes à travers 14 provinces.

Le PDG d’Anthropic dit que DeepSeek était « un peu exagéré »

Lors d’un événement d’affaires, un cofondateur d’Anthropic, l’entreprise qui a créé les modèles d’IA Claude, a déclaré que DeepSeek est toujours « six à huit mois derrière les entreprises de pointe américaines ». Il a également déclaré que le buzz récent autour de la start-up chinoise était « peut-être un peu exagéré ».

DeepSeek a attiré l’attention dans le monde entier à la fin décembre 2024 et au début janvier 2025 en partageant deux modèles d’IA open-source avancés, V3 et R1. Ces modèles ont été conçus pour une fraction minime du coût et de la puissance de calcul que les grandes entreprises technologiques ont généralement besoin pour les projets de LLM.

On ne sait pas quand DeepSeek publiera la prochaine génération de ses modèles. L’entreprise basée à Hangzhou a discrètement publié son Prover-V2 à 671 milliards de paramètres fin avril. Il s’agissait d’une mise à jour de son modèle spécialisé pour la gestion des preuves mathématiques. Cependant, elle n’a rien dit sur les progrès de son tant attendu modèle de raisonnement R2.

Si vous lisez ceci, vous êtes déjà en avance. Restez ainsi grâce à notre newsletter.

Partager cet article

Avertissement. Les informations fournies ne constituent pas des conseils en matière d'investissement. Cryptopolitan.com ne saurait être tenue responsable des investissements réalisés sur la base des informations fournies sur cette page. Nous recommandons vivement de mener vos propres recherches et/ou de consulter un professionnel qualifié avant de prendre toute décision d'investissement.

Florence Muchai

Florence Muchai

Florence couvre depuis 6 ans l'actualité crypto, du jeu vidéo, de la technologie et de l'IA. Ses études en informatique à l'Université de sciences et technologies de Meru et sa formation en gestion des catastrophes et en diplomatie internationale à l'MMUST lui ont amplement permis de développer des compétences linguistiques, d'observation et techniques. Florence a travaillé au sein du groupe VAP et en tant qu'éditrice pour plusieurs médias spécialisés dans la crypto.

PLUS D'ACTUALITÉS…