Cerebras défie Nvidia en lançant un service d'inférence IA

Cerebras lance des services d'inférence IA avec ses puces Waffer Scale Engine.
- Cerebras, un fabricant de puces innovant, a lancé son propre service d’inférence IA.
- L’entreprise utilisera ses dernières puces Wafer Scale Engine, plus rapides que les GPU traditionnels.
- Cerebras propose ce service à un prix nettement plus abordable : 10 cents par million de tokens.
Cerebras Systems a annoncé une solution d'inférence IA pour les développeurs mardi. Selon les affirmations de l'entreprise, il s'agit d'une solution d'inférence beaucoup plus rapide, 20 fois plus rapide que les offres de Nvidia.
Cerebras fournira l'accès à ses puces plus grandes pour exécuter des applications IA, qui, selon l'entreprise, sont également moins chères que les GPU Nvidia. Les GPU Nvidia, norme de l'industrie, sont souvent accessibles via des fournisseurs de services cloud pour exécuter de grands modèles de langage tels que ChatGPT. L'accès n'est généralement pas facile pour de nombreuses petites entreprises et est coûteux.
Cerebras affirme que ses nouvelles puces peuvent offrir des performances supérieures à celles des GPU
L'inférence IA est le processus d'utilisation d'un modèle IA déjà entraîné pour obtenir une sortie, comme des réponses de chatbots et la résolution de différentes tâches. Les services d'inférence sont la colonne vertébrale des applications IA d'aujourd'hui, car ils s'y appuient pour les opérations quotidiennes afin de faciliter l'utilisation par les utilisateurs.
Cerebras a déclaré que l'inférence est le segment à la croissance la plus rapide de l'industrie IA, représentant 40 % de toutes les charges de travail liées à l'IA dans le cloud computing. Le PDG de Cerebras, Andrew Feldman, a déclaré que les puces surdimensionnées de l'entreprise offrent plus de performances qu'un GPU. Les GPU ne peuvent pas atteindre ce niveau, a-t-il ajouté. Feldman s'exprimait dans une interview avec Reuters.
Il a ajouté:
« Nous le faisons avec la plus grande précision, et nous l'offrons au prix le plus bas. » Source : Reuters.
Le PDG a déclaré que les services d'inférence IA existants ne satisfont pas tous les clients. Il a déclaré à un groupe séparé de journalistes à San Francisco que l'entreprise « observe tout un éventail d'intérêts » pour des solutions plus rapides et rentables.
Jusqu'à présent, Nvidia a dominé le marché du calcul IA avec ses puces de référence et son environnement de programmation Compute Unified Device Architecture (CUDA). Cela a aidé Nvidia à verrouiller les développeurs dans son écosystème en fournissant un vaste éventail d'outils.
Les puces Cerbras ont 7000 fois plus de mémoire que les GPU Nvidia H100
Cerebras a déclaré que son service d'inférence à haute vitesse est un tournant pour l'industrie IA. Les nouvelles puces de l'entreprise, aussi grandes que des assiettes à dîner, sont appelées Wafer Scale Engines. Elles peuvent traiter 1000 jetons par seconde, ce que l'entreprise compare à l'introduction d'Internet haut débit.
Selon l'entreprise, les nouvelles puces offrent différentes quantités de sortie pour divers modèles IA. Pour Llama 3.1 8B, les nouvelles puces peuvent traiter jusqu'à 1800 jetons par seconde, tandis que pour Llama 3.1 70B, elles peuvent en traiter 450 par seconde.
Cerebras propose des services d'inférence à 10 cents pour un million de jetons, ce qui est moins cher que ceux basés sur des GPU. Habituellement, les approches alternatives compromettent la précision pour la performance, selon les croyances de l'industrie, tandis que les nouvelles puces de Cerebras sont capables de maintenir la précision, selon les affirmations de l'entreprise.
Cerebras a déclaré qu'elle proposera des produits d'inférence IA sous différentes formes. L'entreprise prévoit d'introduire un service d'inférence via son cloud et une clé développeur. L'entreprise vendra également les nouvelles puces aux clients de centres de données et à ceux qui souhaitent exploiter leurs propres systèmes.
Les nouvelles puces Wafer Scale Engine disposent de leurs propres modules de refroidissement et de distribution d'intégrés et font partie d'un système de centre de données Cerebras appelé CS-3. Selon différents rapports, le système Cerebras CS-3 est la colonne vertébrale du service d'inférence de l'entreprise.
Le système dispose d'une capacité de mémoire 7000 fois supérieure à celle des GPU Nvidia H100. Cela résout également le problème fondamental de la bande passante mémoire, que de nombreux fabricants de puces tentent d'adresser.
Cerbras travaille également à devenir une société cotée en bourse. Pour ce faire, elle a déposé un prospectus confidentiel auprès de la Securities and Exchange Commission (SEC) ce mois-ci.
Si vous lisez ceci, vous êtes déjà en avance. Restez ainsi grâce à notre newsletter.
Avertissement. Les informations fournies ne constituent pas des conseils en matière d'investissement. Cryptopolitan.com ne saurait être tenue responsable des investissements réalisés sur la base des informations fournies sur cette page. Nous recommandons vivement de mener vos propres recherches et/ou de consulter un professionnel qualifié avant de prendre toute décision d'investissement.

Aamir Sheikh
Aamir est journaliste technologique avec près de six ans d'expérience dans les secteurs de la cryptomonnaie et de la technologie. Il est diplômé de l'université MAJ avec un MBA en finance et marketing. Il travaille désormais pour Cryptopolitan, où il rend compte des dernières évolutions des marchés de la cryptomonnaie et des prévisions de prix.
















