Cerebras sfida Nvidia lanciando un servizio di inferenza AI

Cerebras introduce servizi di inferenza AI con chip Wafer Scale Engine.
- Cerebras, un innovativo produttore di chip, ha lanciato il proprio servizio di inferenza AI.
- L'azienda utilizzerà i suoi ultimi chip Wafer Scale Engine, più veloci delle GPU tradizionali.
- Crebras offre il servizio a un prezzo molto più accessibile di 10 centesimi per milione di token.
Cerebras Systems ha annunciato martedì una soluzione di inferenza AI per gli sviluppatori. Secondo le dichiarazioni dell'azienda, si tratta di una soluzione di inferenza molto più veloce, 20 volte più veloce delle offerte di Nvidia.
Cerebras fornirà l'accesso ai suoi chip più grandi per eseguire applicazioni AI, che, secondo l'azienda, sono anche più economiche delle GPU Nvidia. Le GPU Nvidia, standard del settore, sono spesso accessibili tramite provider di servizi cloud per eseguire modelli linguistici di grandi dimensioni come ChatGPT. Ottenere l'accesso di solito non è facile per molte piccole imprese ed è costoso.
Cerebras afferma che i suoi nuovi chip possono offrire prestazioni superiori alle GPU
L'inferenza AI è il processo di esecuzione di un modello AI già addestrato per ottenere un output, come risposte dai chatbot e risoluzione di diversi compiti. I servizi di inferenza sono la spina dorsale delle applicazioni AI di oggi, poiché si affidano ad essi per le operazioni quotidiane per facilitare gli utenti.
Cerebras ha dichiarato che l'inferenza è il segmento in più rapida crescita del settore AI, rappresentando il 40% di tutti i carichi di lavoro correlati all'AI nel cloud computing. Il CEO di Cerebras, Andrew Feldman, ha detto che i chip sovradimensionati dell'azienda offrono più prestazioni di una GPU. Le GPU non possono raggiungere questo livello, ha detto. Feldman stava parlando a Reuters in un'intervista.
Ha aggiunto,
"Lo facciamo alla massima accuratezza e lo offriamo al prezzo più basso." Fonte: Reuters.
Il CEO ha dichiarato che i servizi di inferenza AI esistenti non sono soddisfacenti per tutti i clienti. Ha detto a un gruppo separato di reporter a San Francisco che l'azienda sta "vedendo ogni tipo di interesse" per soluzioni più veloci ed economiche.
Fino ad ora, Nvidia ha dominato il mercato del computing AI con i suoi chip di riferimento e l'ambiente di programmazione Compute Unified Device Architecture (CUDA). Questo ha aiutato Nvidia a bloccare gli sviluppatori nel suo ecosistema fornendo una vasta gamma di strumenti.
I chip Cerbras hanno 7000 volte più memoria delle GPU H100 di Nvidia
Cerebras ha affermato che il suo servizio di inferenza ad alta velocità è un punto di svolta per il settore AI. I nuovi chip dell'azienda, grandi come piatti da cena, sono chiamati Wafer Scale Engines. Possono elaborare 1000 token al secondo, che l'azienda ha definito paragonabile all'introduzione di internet a banda larga.
Secondo l'azienda, i nuovi chip offrono diverse quantità di output per vari modelli AI. Per Llama 3.1 8B, i nuovi chip possono elaborare fino a 1800 token al secondo, mentre per Llama 3.1 70B, possono elaborare 450 token al secondo.
Cerebras offre servizi di inferenza a 10 centesimi per un milione di token, che è meno di quelli basati su GPU. Di solito, gli approcci alternativi compromettono l'accuratezza per le prestazioni, secondo le credenze del settore, mentre i nuovi chip di Cerebras sono in grado di mantenere l'accuratezza, secondo le dichiarazioni dell'azienda.
Cerebras ha detto che offrirà prodotti di inferenza AI in diverse forme. L'azienda prevede di introdurre un servizio di inferenza tramite il suo cloud e una chiave per sviluppatori. L'azienda venderà anche i nuovi chip ai clienti dei data center e a coloro che vogliono gestire i propri sistemi.
I nuovi chip Wafer Scale Engine hanno i propri moduli di raffreddamento e distribuzione dell'integrazione e fanno parte di un sistema data center Cerebras chiamato CS-3. Secondo diversi rapporti, il sistema Cerebras CS-3 è la spina dorsale del servizio di inferenza dell'azienda.
Il sistema vanta una capacità di memoria 7000 volte superiore rispetto alle GPU Nvidia H100. Questo risolve anche il problema fondamentale della larghezza di banda della memoria, che molti produttori di chip stanno cercando di affrontare.
Cerbras sta anche lavorando per diventare un'azienda quotata in borsa. Per farlo, ha depositato un prospetto riservato presso la Securities and Exchange Commission (SEC) questo mese.
Non limitarti a leggere le notizie sulle criptovalute. Comprendile. Iscriviti alla nostra newsletter. È gratuita.
Dichiarazione di responsabilità. Le informazioni fornite non costituiscono consigli di trading. Cryptopolitan.com non si assume alcuna responsabilità per eventuali investimenti effettuati sulla base delle informazioni fornite in questa pagina. Si consiglia vivamente di effettuare ricerche indipendenti e/o consultare un professionista qualificato prima di prendere qualsiasi decisione di investimento.

Aamir Sheikh
Aamir è un giornalista tecnologico con quasi sei anni di esperienza nei settori delle criptovalute e della tecnologia. Si è laureato presso l'Università MAJ con un MBA in Finanza e Marketing. Attualmente lavora per Cryptopolitan, dove si occupa delle ultime novità sui mercati delle criptovalute e delle previsioni sui prezzi.
















