Nvidia H20 e H200 aiutano a far funzionare modelli AI addestrati interamente su dataset sintetici cinesi

-
Tsinghua e Microsoft hanno addestrato un modello di codifica AI completo utilizzando solo dati sintetici, senza input del mondo reale in nessuna fase.
-
Il modello ha utilizzato chip Nvidia H20 e H200, superando modelli di codifica più grandi nonostante abbia meno parametri e meno dati.
-
La Cina ha anche presentato il chip ACCEL basato sulla luce, che ha raggiunto 4,6 PFLOPS consumando milioni di volte meno energia rispetto agli attuali chip per AI.
L'Università di Tsinghua e Microsoft Research Asia hanno addestrato un modello AI completo utilizzando solo dati falsi. Nessun campione del mondo reale.
L'intero dataset è stato generato artificialmente attraverso una nuova pipeline chiamata SynthSmith, e il sistema è stato eseguito su chip Nvidia dall'inizio alla fine. Il team non si è limitato a realizzare un test di novità. Ha costruito un modello funzionante con 7 miliardi di parametri che ha superato modelli molto più grandi addestrati su dati umani.
Il loro articolo, pubblicato il 11 gennaio su arXiv, afferma che X-Coder, da loro addestrato, ha superato i modelli di codifica con 14 miliardi di parametri, anche se non ha mai visto testo del mondo reale.
“Un'analisi approfondita rivela che le leggi di scaling valgono sul nostro dataset sintetico”, hanno scritto i ricercatori. Questo team includeva nomi dell'Università di Tsinghua, Microsoft Research Asia e dell'Università di Wuhan.
I ricercatori usano chip Nvidia per saltare completamente i dati del mondo reale
L'allestimento per l'addestramento si basava pesantemente sull'hardware Nvidia. Per il fine-tuning supervisionato, hanno utilizzato 128 chip Nvidia H20 per 220 ore consecutive. Dopo quello, hanno passato a 32 chip H200 per altri sette giorni interi per gestire la fase di apprendimento per rinforzo. Queste non erano scelte casuali. L'H20 è ottimizzato per l'inferenza, e l'H200 è costruito per l'addestramento di alto livello. Questi sono i chip più potenti disponibili per le aziende cinesi in questo momento, grazie alle esenzioni dai controlli all'esportazione approvate dall'amministrazione Trump dopo che Nvidia ha fatto forti pressioni per renderli disponibili in Cina.
I ricercatori hanno affermato che la pipeline stessa non era il problema quando si trattava di scalare. La questione era tutta una questione di potenza di calcolo.
Wu Jie, autore principale e studente di master all'Università di Tsinghua, ha dichiarato che la vera ragione per cui non avevano portato la pipeline a modelli da 100 miliardi o trilioni di parametri era semplicemente: “vincoli computazionali, piuttosto che limitazioni della pipeline stessa.”
Rilasciando il codice pubblicamente, sperano che altri possano costruire su questo progetto senza dover sostenere costi di addestramento enormi. L'articolo evidenzia anche una tendenza nell'AI.
Oggi ci si aspetta che i modelli “pensino” per periodi di tempo più lunghi e gestiscano ragionamenti complessi, il che ha aumentato la necessità di molta più potenza di calcolo durante l'inferenza, non solo durante l'addestramento.
Il team cinese costruisce un chip più veloce utilizzando vecchie tecnologie di fabbricazione
Inoltre, un nuovo chip chiamato ACCEL è stato costruito da scienziati cinesi utilizzando particelle di luce, non elettricità. Il chip (abbreviazione di All-Analogue Chip Combining Electronics and Light) è stato testato in laboratorio e ha raggiunto 4,6 PFLOPS.
È 3.000 volte più veloce dell'A100 di Nvidia e il chip cinese ha consumato 4 milioni di volte meno energia. Questo lo rende uno dei chip AI più efficienti mai realizzati per compiti specifici come il riconoscimento di immagini o la guida autonoma.
Non sostituirà ancora le CPU o i chip degli smartphone, ma il team ritiene che potrebbe funzionare nei dispositivi indossabili, nei veicoli elettrici o nelle fabbriche intelligenti.
Il chip è stato costruito utilizzando un processo di 20 anni fa da Semiconductor Manufacturing International Corporation. Ha evitato la necessità di macchine di litografia avanzata che la Cina non può ancora accedere.
“Il deployment dei sistemi di calcolo fotonico era in passato una sfida a causa della complessità del design strutturale e della vulnerabilità al rumore e agli errori di sistema”, ha dichiarato Tsinghua in un articolo.
Il chip evita questo problema combinando elettronica fotonica e analogica in un nuovo framework. Non gestisce compiti di calcolo generali come la compressione di file, ma è ottimo per la visione AI e il rilevamento in condizioni di scarsa illuminazione.
Un dettaglio incredibile: l'energia necessaria per far funzionare i chip moderni per un'ora potrebbe mantenere ACCEL in funzione per 500 anni. Questa bassa richiesta di energia rende anche più facile gestire i problemi di calore, che limitano quanto piccoli possono diventare i chip.
Le funzioni del chip includono l'identificazione del traffico, l'imaging in condizioni di scarsa illuminazione e la visione in tempo reale, utilizzando la luce ambientale direttamente nel processo di rilevamento. Il team ha dichiarato che non è un chip a uso generale, ma soddisfa una necessità molto specifica.
Il finanziamento è arrivato dal Programma Nazionale di R&S e dalla Fondazione Nazionale per le Scienze Naturali della Cina. Una società di chip di Pechino chiamata MakeSens, co-fondata da uno dei ricercatori, è stata coinvolta e ha recentemente lanciato anche un chip analogico a basso consumo.
Dai Qionghai di Tsinghua, uno dei responsabili del progetto, ha dichiarato che costruire una nuova architettura di calcolo era solo il primo passo.
“La sfida più importante è portare questa nuova architettura ad applicazioni pratiche, risolvendo i principali bisogni nazionali e pubblici, che è la nostra responsabilità.”
Il team non ha detto nulla su quando questo chip potrebbe arrivare sul mercato.
I cervelli più intelligenti del crypto leggono già la nostra newsletter. Vuoi unirti a loro? Unisciti a loro.

Jai Hamid
Jai Hamid si occupa di criptovalute, mercati azionari, tecnologia, economia globale ed eventi geopolitici che influenzano i mercati da 6 anni. Ha collaborato con pubblicazioni focalizzate sulla blockchain, tra cui AMB Crypto, Coin Edition e CryptoTale, per analisi di mercato, grandi aziende, regolamentazione e tendenze macroeconomiche. Si è formata presso la London School of Journalism e ha condiviso tre volte le sue analisi sui mercati delle criptovalute su una delle principali reti televisive dell'Africa.
















