Les puces Nvidia H20 et H200 permettent d'entraîner des modèles d'IA entièrement sur des jeux de données synthétiques chinois

-
Tsinghua et Microsoft ont entraîné un modèle de codage IA complet en utilisant uniquement des données synthétiques, sans aucune entrée du monde réel à aucune étape.
-
Le modèle utilisé des puces Nvidia H20 et H200 et a battu des modèles de codage plus volumineux, malgré un nombre inférieur de paramètres et moins de données.
-
La Chine a également dévoilé une puce ACCEL basée sur la lumière qui atteint 4,6 PFLOPS tout en utilisant des millions de fois moins d'énergie que les puces IA existantes.
L'Université Tsinghua et Microsoft Research Asia ont entraîné un modèle d'IA complet en utilisant uniquement des données fictives. Aucun échantillon du monde réel n'a été utilisé.
L'intégralité du jeu de données a été générée artificiellement grâce à un nouveau pipeline appelé SynthSmith, et le système a fonctionné sur des puces Nvidia du début à la fin. L'équipe n'a pas seulement réalisé un test novateur. Elle a construit un modèle fonctionnel de 7 milliards de paramètres qui a surpassé des modèles beaucoup plus grands entraînés sur des données humaines.
Leur article, publié le 11 janvier sur arXiv, affirme que le X-Coder qu'ils ont entraîné surpasse les modèles de codage de 14 milliards de paramètres, bien qu'il n'ait jamais vu de texte du monde réel.
« Une analyse approfondie révèle que les lois d'échelle s'appliquent à notre jeu de données synthétique », ont écrit les chercheurs. Cette équipe comprenait des membres de l'Université Tsinghua, de Microsoft Research Asia et de l'Université de Wuhan.
Les chercheurs utilisent des puces Nvidia pour se passer entièrement des données du monde réel
La configuration d'entraînement s'appuyait fortement sur le matériel Nvidia. Pour le réglage fin supervisé, ils ont utilisé 128 puces Nvidia H20 pendant 220 heures d'affilée. Ensuite, ils sont passés à 32 puces H200 pendant sept jours complets supplémentaires pour gérer la phase d'apprentissage par renforcement. Ce n'étaient pas des choix aléatoires. La H20 est optimisée pour l'inférence, et la H200 est conçue pour l'entraînement haut de gamme. Ce sont les puces les plus puissantes disponibles pour les entreprises chinoises actuellement, grâce aux exemptions de contrôle à l'exportation approuvées par l'administration Trump après que Nvidia ait fait lobby avec force pour les rendre disponibles en Chine.
Les chercheurs ont déclaré que le problème ne résidait pas dans le pipeline lui-même lors de la mise à l'échelle. Tout dépendait de la puissance de calcul.
Wu Jie, auteur principal et étudiant en master à Tsinghua, a déclaré que la véritable raison pour laquelle ils n'avaient pas porté le pipeline à des modèles de 100 milliards ou d'un trillion de paramètres était simplement : « des contraintes computationnelles, et non des limitations du pipeline lui-même ».
En rendant le code public, ils espèrent que d'autres pourront s'appuyer sur ce projet sans avoir à supporter des coûts d'entraînement exorbitants. L'article souligne également une tendance dans le domaine de l'IA.
Les modèles sont désormais censés « réfléchir » sur des périodes plus longues et gérer un raisonnement complexe, ce qui a accru le besoin de puissance de calcul lors de l'inférence, et pas seulement lors de l'entraînement.
Une équipe chinoise conçoit une puce plus rapide en utilisant une technologie de fabrication ancienne
Séparément, une nouvelle puce appelée ACCEL a été construite par des scientifiques chinois en utilisant des particules de lumière, et non de l'électricité. La puce (abrégé de All-Analogue Chip Combining Electronics and Light) a été testée en laboratoire et a atteint 4,6 PFLOPS.
C'est 3 000 fois plus rapide que l'A100 de Nvidia, et la puce chinoise a utilisé 4 millions de fois moins d'énergie. Cela en fait l'une des IA puces les plus efficaces jamais créées pour des tâches spécifiques comme la reconnaissance d'images ou la conduite autonome.
Elle ne remplacera pas les CPU ou les puces de smartphones pour le moment, mais l'équipe pense qu'elle pourrait fonctionner dans les objets connectés portables, les véhicules électriques ou les usines intelligentes.
La puce a été fabriquée avec un processus vieux de 20 ans par Semiconductor Manufacturing International Corporation. Elle a évité le besoin de machines de lithographie avancée, auxquelles la Chine n'a toujours pas accès.
« Le déploiement de systèmes de calcul photonique était auparavant un défi en raison de la complexité de leur conception structurelle et de leur vulnérabilité au bruit et aux erreurs du système », a déclaré Tsinghua dans un article.
La puce contourne ce problème en combinant l'électronique photonique et analogique dans un nouveau cadre. Elle ne gère pas les tâches de calcul général comme la compression de fichiers, mais elle est excellente pour la vision par ordinateur de l'IA et la détection en faible luminosité.
Un détail surprenant : l'énergie nécessaire pour faire fonctionner les puces modernes pendant une heure pourrait suffire à faire fonctionner ACCEL pendant 500 ans. Cette faible demande d'énergie facilite également la gestion des problèmes de chaleur, qui limitent la miniaturisation des puces.
Les fonctions de la puce incluent l'identification du trafic, l'imagerie en faible luminosité et la vision en temps réel, en utilisant directement la lumière ambiante dans le processus de détection. L'équipe a précisé qu'il ne s'agit pas d'une puce à usage général, mais qu'elle répond à un besoin très spécifique.
Le financement provient du Programme national de R&D clé et de la Fondation nationale des sciences naturelles de Chine. Une entreprise de puces basée à Pékin, MakeSens, cofondée par l'un des chercheurs, a été impliquée et a récemment lancé une puce analogique à faible consommation.
Dai Qionghai de Tsinghua, l'un des responsables du projet, a déclaré que la construction d'une nouvelle architecture de calcul n'était que la première étape.
« Le défi le plus important est d'amener cette nouvelle architecture à des applications pratiques, en répondant aux besoins nationaux et publics majeurs, ce qui est notre responsabilité. »
L'équipe n'a rien annoncé concernant la date de mise sur le marché de cette puce.
Les esprits les plus brillants du secteur crypto lisent déjà notre newsletter. Vous aussi ? Rejoignez-les.

Jai Hamid
Jai Hamid couvre les cryptomonnaies, les marchés boursiers, la technologie, l'économie mondiale et les événements géopolitiques qui affectent les marchés depuis 6 ans. Elle a travaillé avec des publications axées sur la blockchain, notamment AMB Crypto, Coin Edition et CryptoTale, sur des analyses de marché, des entreprises majeures, la réglementation et les tendances macroéconomiques. Elle est diplômée de la London School of Journalism et a partagé à trois reprises des analyses du marché des cryptomonnaies sur l'une des principales chaînes de télévision d'Afrique.
















