Il chip $20B di NVIDIA potrebbe far sembrare lento ChatGPT

- NVIDIA si sta preparando a svelare un nuovo chip di inferenza AI durante il suo annuale NVIDIA GTC, progettato per generare risposte più velocemente dei sistemi attuali come ChatGPT.
- Il chip è focalizzato sull'inferenza AI e segue l'accordo di circa 20 miliardi di dollari di Nvidia per la licenza della tecnologia e l'ingresso dei fondatori di Groq.
- Gli analisti si aspettano che l'inferenza AI domini le future spese nei data center, anche mentre rivali come Meta Platforms sviluppano i propri processori per l'inferenza.
sta preparando di svelare un nuovo potente processore di intelligenza artificiale progettato per accelerare il modo in cui i chatbot e altri strumenti AI generano risposte, potenzialmente rendendo i sistemi di oggi come , e Microsoft, insieme all'ETF QQQ. apparentemente lenti in confronto. ChatGPT La nuova piattaforma, prevista per debuttare alla conferenza annuale per sviluppatori GTC di NVIDIA, è ottimizzata per l'inferenza AI, la fase in cui i modelli addestrati producono risposte ai prompt degli utenti. A differenza delle GPU tradizionali costruite per gestire sia l'addestramento che l'inferenza, il processore in arrivo si concentra specificamente sul fornire risposte più velocemente e in modo più efficiente.
Alla fine dello scorso anno, NVIDIA avrebbe speso circa 20 miliardi di dollari per licenziare la tecnologia dallo startup di chip Groq e reclutare personale chiave, incluso il suo CEO. Nello stesso periodo, il CEO di NVIDIA Jensen Huang ha detto ai dipendenti: «Pianifichiamo di integrare i processori a bassa latenza di Groq nell'architettura della fabbrica AI di NVIDIA, estendendo la piattaforma per servire una gamma ancora più ampia di inferenza AI e carichi di lavoro in tempo reale».
Il prodotto, se lanciato, segnalerà il primo risultato tangibile dell'accordo di dicembre che ha portato i fondatori di Groq a far parte del gruppo, la cui azienda si specializza in hardware di elaborazione AI ad alta velocità.
Ora, il nuovo chip di inferenza dovrebbe gestire query AI complesse ad alta velocità, con
e altri clienti leader probabilmente ad adottarlo, secondo il Wall Street Journal. Il suo rapporto ha anche mostrato che il nuovo chip potrebbe gestire quasi il 10% del carico di lavoro di inferenza di OpenAI. pone il pubblico del piano gratuito di ChatGPT a più di 1 miliardo di utenti attivi settimanali, e il modello pubblicitario è ciò che aiuta a mantenere in funzione la versione gratuita. Il chip in stile Groq utilizzerà SRAM, dicono le fonti
Durante una recente chiamata sugli utili, il CEO di NVIDIA ha accennato che diversi
nuovi prodotti saranno svelati all'evento GTC in arrivo, spesso descritto come il «Super Bowl dell'AI». Ha osservato: «Ho alcune grandi idee che vorrei condividere con voi a GTC». La maggior parte degli analisti concorda sul fatto che il chip in stile Groq potrebbe far parte della lineup. Hanno anche affermato che il suo design potrebbe gettare luce su come NVIDIA mira ad affrontare i vincoli di memoria nel calcolo dell'inferenza. Tali piattaforme tipicamente funzionano su memoria ad alta larghezza di banda (HBM). Tuttavia, l'HBM è stata difficile da reperire recentemente.
Gli insider hanno
che l'azienda prevede di utilizzare SRAM nel chip piuttosto che la RAM dinamica associata all'HBM. Idealmente, l'SRAM è più accessibile e può migliorare le prestazioni dei carichi di lavoro di ragionamento AI. affermato Se il chip viene svelato, potrebbe essere un grande passo avanti per l'azienda di chip e i modelli addestrati con AI. Tuttavia, parlando del suo possibile lancio, Sid Sheth, fondatore e CEO di d-Matrix, ha gettato un'ombra sul suo sviluppo. Ha notato che mentre NVIDIA rimane il chiaro leader nell'addestramento AI, l'inferenza rappresenta un panorama molto diverso. Ha condiviso: «Gli sviluppatori possono rivolgersi a concorrenti diversi da NVIDIA perché eseguire modelli AI finiti non richiede lo stesso tipo di programmazione del loro addestramento».
Tuttavia, altri giganti della tecnologia stanno anche avanzando nel calcolo dell'inferenza. Meta questa settimana ha svelato quattro processori su misura per l'inferenza, spingendo un investitore della Silicon Valley a dire che l'industria potrebbe entrare in una fase non «dominante di NVIDIA».
Tuttavia, più recentemente, June Paik, amministratore delegato di FuriosaAI, un rivale di NVIDIA, commentando il vantaggio del calcolo dell'inferenza facilmente deployabile, ha avvertito che la maggior parte dei data center non può accommodare le ultime GPU raffreddate a liquido.
Nonostante le sue preoccupazioni, gli analisti di Bank of America si aspettano che i carichi di lavoro di inferenza rappresentino il 75% della spesa dei data center AI entro il 2030, quando il mercato raggiungerà circa 1,2 trilioni di dollari, in aumento rispetto al circa 50% dello scorso anno. Ben Bajarin, analista tecnologico di Creative Strategies, ha anche affermato che i data center del futuro non si conformeranno a un modello unico, prevedendo che le aziende adotteranno approcci diversi allo sviluppo di chip e strutture.
NVIDIA dovrebbe rilasciare i chip Vera Rubin più tardi in ⟦N1⟧
Si prevede che NVIDIA rilascerà i chip Vera Rubin più tardi in 2026
NVIDIA ha anche recentemente lanciato i suoi chip AI di nuova generazione, i chip AI Vera Rubin, prevedendo che l'ascesa di piattaforme AI di ragionamento come DeepSeek alimenterà una domanda di calcolo ancora maggiore. Ha affermato che i chip aiuteranno ad addestrare modelli AI più grandi e a fornire output più sofisticati a una base di utenti più ampia.
Secondo Huang, Rubin arriverà anche sul mercato nel secondo semestre del 2026, con una versione "ultra" di fascia alta prevista per il 2027.
Ha anche spiegato che un singolo sistema Rubin combinerà 576 GPU individuali in un unico chip. Attualmente, il chip Blackwell di NVIDIA raggruppa 72 GPU nel suo sistema NVL72, il che significa che Rubin presenterà una memoria più avanzata.
Se stai leggendo questo, sei già avanti. Resta così con la nostra newsletter.

Nellius Irene
Nellius è una laureata in Gestione Aziendale e Informatica con cinque anni di esperienza nel settore delle criptovalute. È anche diplomata presso Bitcoin Dada. Nellius ha contribuito a principali testate giornalistiche, tra cui BanklessTimes, Cryptobasic e Riseup Media.
















