DERNIÈRES ACTUALITÉS
SÉLECTIONNÉ POUR VOUS

DeepSeek dévoile mHC mais fait face à des obstacles liés à l'examen par les pairs

ParEnacy MapakameEnacy Mapakame 3 min de lecture
DeepSeek dévoile mHC mais fait face à des obstacles dans l'examen par les pairs.
  • DeepSeek propose une nouvelle méthode pour mettre à l'échelle l'IA sans puissance de calcul supplémentaire.
  • Les chercheurs voient du potentiel mais avertissent que davantage de tests sont encore nécessaires.
  • mHC pourrait transformer la formation des grands modèles de langage.

À une époque où les coûts croissants du développement et de la maintenance de l'IA et la quantité limitée de matériel disponible posent problème, DeepSeek a présenté un nouveau plan pour développer et mettre à l'échelle l'intelligence artificielle (IA).

La start-up chinoise estime pouvoir créer des modèles d'IA nettement meilleurs sans nécessairement ajouter plus de puces, augmentant ainsi la consommation d'énergie. Bien que le concept mHC proposé ait suscité une grande attention parmi de nombreux chercheurs dans ce domaine, il est généralement considéré comme étant encore à un stade précoce.

Des recherches supplémentaires seront nécessaires pour déterminer les avantages de cette approche dans le développement de systèmes d'IA plus grands. Un article technique détaillant le concept mHC a été publié la semaine dernière et est co-signé par Liang Wenfeng, fondateur et PDG de DeepSeek.

DeepSeek repense la conception du réseau pour mettre à l'échelle l'IA

L'un des principaux composants du travail consiste à réévaluer la manière dont les informations sont transférées entre les différentes couches d'un réseau neuronal multicouche.

Chaque couche d'un réseau neuronal transmet une forme d'information traitée à la couche suivante du modèle, créant ce qui a été appelé un « Réseau d'Apprentissage Résiduel » (ResNet). Développé par Kaiming He et d'autres de Microsoft Research il y a environ dix ans, les ResNets ont fourni la base fondamentale à un certain nombre des systèmes d'IA les plus avancés d'aujourd'hui.

Un concept développé par DeepSeek a été créé après que ByteDance a introduit Hyper-Connections en 2024. Les Hyper-Connections permettent à l'information de voyager sur plusieurs routes à travers un réseau, plutôt que sur un seul chemin principal, ce qui peut augmenter la vitesse d'apprentissage et la richesse de l'expérience.

Cependant, bien qu'ils puissent être bénéfiques, ils peuvent également entraîner des problèmes lors de l'entraînement, où les modèles subissent une instabilité d'entraînement ou un échec complet.

Selon Song Linqi (Université de la ville de Hong Kong), la recherche de DeepSeek est une progression d'une idée existante, une continuation de la façon dont DeepSeek examine le travail des autres entreprises, plutôt que d'inventer quelque chose à partir de zéro.

ResNet est comparé à une autoroute à une voie tandis que les Hyper-Connections ressemblent à une autoroute à plusieurs voies ; cependant, Song a mis en garde en disant que la présence de plusieurs voies sans règles appropriées peut entraîner davantage de collisions.

Le professeur Guo Song de l'Université de Science et Technologie de Hong Kong estime que ce document de recherche peut indiquer un changement de comportement de recherche pour la recherche en IA. Au lieu de continuer à apporter de petites modifications aux conceptions des modèles existants, il estime que la recherche pourrait évoluer vers le développement de nouveaux modèles basés sur des constructions théoriques.

Les chercheurs testent mHC mais soulèvent des préoccupations pratiques

Bien que l'enthousiasme soit au rendez-vous suite à la récente étape clé atteinte dans les tests de mHC pour l'apprentissage profond, les experts ont souligné que la recherche n'est pas encore terminée. Les tests fournis par DeepSeek n'ont utilisé que quatre chemins de données lors des tests de modèles avec 27 milliards de paramètres.

« Les expériences ont validé les modèles jusqu'à 27 milliards de paramètres, mais comment se comporteraient-ils sur les modèles de pointe actuels qui sont d'un ordre de grandeur plus grands ? »

Professeur Guo Song.

Les modèles d'IA disponibles aujourd'hui sont plus grands et comportent généralement des centaines de milliards de paramètres, par rapport aux 30 milliards de paramètres qui étaient la norme il y a seulement quelques années.

Guo a fait écho à ces sentiments et a déclaré que personne ne peut encore conclure si mHC sera capable de travailler à la pointe de la technologie de l'IA. Il a également déclaré que l'infrastructure nécessaire au fonctionnement de mHC pourrait être trop avancée pour les petites institutions de recherche et pour que les entreprises l'utilisent sur les appareils mobiles.

Selon Cryptopolitan, la popularité de DeepSeek provient de la publication de son grand modèle de langage DeepSeek V3, suivie quelques semaines plus tard par la sortie de son modèle de raisonnement DeepSeek-R1.

Lors de la comparaison des résultats des modèles à ceux de leurs concurrents lors des tests de référence, les deux modèles ont été capables d'atteindre ou de dépasser les résultats de leurs concurrents, bien qu'ils aient été publiés en utilisant seulement une fraction des données d'entraînement utilisées pour les autres modèles de langage concurrents.

Ne vous contentez pas de lire les actualités crypto. Comprenez-les. Abonnez-vous à notre newsletter. C'est gratuit.

Partager cet article
Enacy Mapakame

Enacy Mapakame

Enacy Mapakame est journaliste avec plus de 10 ans d'expérience dans les actualités économiques et financières. Elle couvre les marchés capitalistiques et les technologies émergentes – le métavers, l'IA et la cryptomonnaie. Enacy détient un diplôme de licence (BSc) en études médiatiques et sociales avec mention.

PLUS D'ACTUALITÉS…