DERNIÈRES ACTUALITÉS
SÉLECTIONNÉ POUR VOUS

La puce de 20 milliards de dollars de NVIDIA pourrait rendre ChatGPT lent

ParNellius IreneNellius Irene 3 min de lecture
La puce de  20 milliards de dollars de NVIDIA pourrait rendre ChatGPT lent.
  • NVIDIA se prépare à dévoiler une nouvelle puce d'inférence IA lors de son événement annuel NVIDIA GTC, conçue pour générer des réponses plus rapidement que les systèmes actuels comme ChatGPT.
  • La puce est axée sur l'inférence IA et fait suite à l'accord d'environ 20 milliards de dollars de Nvidia pour la licence de technologie et l'embauche des fondateurs de Groq.
  • Les analystes s'attendent à ce que l'inférence IA domine les futurs investissements dans les centres de données, même alors que des concurrents comme Meta Platforms développent leurs propres processeurs d'inférence.

Le géant des puces , Amazon, Meta Platforms Inc., Tesla, Alphabet, se prépare à dévoiler un nouveau processeur d'intelligence artificielle puissant conçu pour accélérer la façon dont les chatbots et autres outils IA génèrent des réponses, rendant potentiellement les systèmes actuels comme ChatGPT lents par comparaison.

La nouvelle plateforme, dont le lancement est attendu lors de la conférence annuelle GTC pour les développeurs de NVIDIA, est optimisée pour l'inférence IA, l'étape où les modèles entraînés produisent des réponses aux invites des utilisateurs. Contrairement aux GPU traditionnels conçus pour gérer à la fois l'entraînement et l'inférence, le processeur à venir se concentre spécifiquement sur la livraison de réponses plus rapides et plus efficaces.

Le produit, s'il est lancé, marquera le premier résultat tangible de l'accord de décembre qui a intégré les fondateurs de Groq, dont l'entreprise est spécialisée dans le matériel de traitement IA à haute vitesse.

Fin de l'année dernière, NVIDIA aurait dépensé environ 20 milliards de dollars pour licencier la technologie de la startup de puces Groq et recruter du personnel clé, y compris son PDG. À peu près au même moment, le PDG de NVIDIA, Jensen Huang, a déclaré aux employés : « Nous prévoyons d'intégrer les processeurs à faible latence de Groq dans l'architecture de l'usine IA de NVIDIA, étendant la plateforme pour servir une gamme encore plus large d'inférences IA et de charges de travail en temps réel. »

Maintenant, le nouveau processeur d'inférence devrait gérer des requêtes IA complexes à grande vitesse, avec OpenAI et d'autres clients de premier plan susceptibles de l'adopter, selon The Wall Street Journal. Son rapport a également montré que le nouveau processeur pourrait gérer près de 10 % de la charge de travail d'inférence d'OpenAI.

La puce de style Groq utiliserait de la SRAM, selon les sources

Lors d'un récent appel sur les résultats, le PDG de NVIDIA a laissé entendre que plusieurs nouveaux produits seraient dévoilés lors de l'événement GTC à venir, souvent décrit comme le « Super Bowl de l'IA ». Il avait remarké : « J'ai quelques excellentes idées que j'aimerais partager avec vous lors de GTC. » 

La plupart des analystes s'accordent à dire que la puce de style Groq pourrait faire partie de la gamme. Ils ont également déclaré que sa conception pourrait éclairer la façon dont NVIDIA compte répondre aux contraintes de mémoire dans le calcul d'inférence. De telles plateformes fonctionnent généralement sur de la mémoire à haut débit (HBM). Cependant, la HBM a été difficile à se procurer récemment.

Des initiés ont a affirmé indiqué que l'entreprise prévoit d'utiliser de la SRAM dans la puce plutôt que la RAM dynamique associée à la HBM. Idéalement, la SRAM est plus accessible et peut améliorer les performances des charges de travail de raisonnement IA.

Si la puce est dévoilée, cela pourrait être une grande avancée pour l'entreprise de puces et les modèles entraînés par IA. Cependant, s'exprimant sur son lancement possible, Sid Sheth, fondateur et PDG de d-Matrix, a jeté un doute sur son développement. Il a noté que bien que NVIDIA reste le leader clair dans l'entraînement IA, l'inférence représente un paysage très différent. Il a partagé : « Les développeurs peuvent se tourner vers des concurrents autres que NVIDIA car l'exécution de modèles IA terminés ne nécessite pas le même type de programmation que leur entraînement. » 

Néanmoins, d'autres géants de la technologie font également avancer le calcul d'inférence. Meta a dévoilé cette semaine quatre processeurs adaptés à l'inférence, incitant un investisseur de la Silicon Valley à dire que l'industrie pourrait entrer dans une phase non « dominée par NVIDIA ».

Cependant, plus récemment, June Paik, PDG de FuriosaAI, un rival de NVIDIA, commentant les avantages du calcul d'inférence facilement déployable, a mis en garde contre le fait que la plupart des centres de données ne peuvent pas accueillir les derniers GPU à refroidissement liquide.

Néanmoins, malgré ses inquiétudes, les analystes de Bank of America s'attendent à ce que les charges de travail d'inférence représentent 75 % des dépenses des centres de données IA d'ici 2030, lorsque le marché atteindra environ 1,2 billion de dollars, en hausse par rapport aux 50 % de l'année dernière. Ben Bajarin, analyste technologique chez Creative Strategies, a également affirmé que les centres de données de l'avenir ne se conformeront pas à un modèle unique, anticipant que les entreprises adopteront des approches différentes pour le développement des puces et des installations.

NVIDIA devrait publier les puces Vera Rubin plus tard en 2026

NVIDIA a également récemment déployé ses puces IA de nouvelle génération, les puces IA Vera Rubin, anticipant que la montée des plateformes IA de raisonnement telles que DeepSeek alimentera une demande de calcul encore plus grande. Elle a affirmé que les puces aideraient à entraîner des modèles IA plus grands et à fournir des sorties plus sophistiquées à une base d'utilisateurs plus large. 

Selon Huang, Rubin arrivera également sur le marché au deuxième semestre 2026, avec une version « ultra » haut de gamme prévue en 2027.

Il a également expliqué qu'un seul système Rubin combinerait 576 GPU individuels en une seule puce. Actuellement, les clusters de puces Blackwell de NVIDIA regroupent 72 GPU dans son système NVL72, ce qui signifie que Rubin disposera d'une mémoire plus avancée.

Si vous lisez ceci, vous êtes déjà en avance. Restez ainsi grâce à notre newsletter.

Nellius Irene

Nellius Irene

Nellius est diplômée en gestion d'entreprise et en informatique, avec cinq ans d'expérience dans l'industrie des cryptomonnaies. Elle est également diplômée de Bitcoin Dada. Nellius a contribué à des publications médiatiques de premier plan, dont BanklessTimes, Cryptobasic et Riseup Media.

PLUS D'ACTUALITÉS…