DeepSeek svela mHC ma affronta ostacoli alla revisione tra pari

- DeepSeek propone un nuovo modo per scalare l'IA senza potenza di calcolo aggiuntiva.
- I ricercatori vedono promesse ma avvertono che sono necessari ulteriori test.
- mHC potrebbe ridefinire il modo in cui vengono addestrati i grandi modelli linguistici.
In un momento in cui ci sono problemi con i costi crescenti di sviluppo e mantenimento dell'AI e la quantità limitata di hardware disponibile, DeepSeek ha presentato un nuovo piano per lo sviluppo e la scalabilità dell'intelligenza artificiale (AI).
La startup con sede in Cina crede di poter creare modelli AI significativamente migliori senza necessariamente aggiungere più chip e quindi aumentare il consumo di energia. Sebbene il concetto mHC proposto abbia attirato l'attenzione significativa di molti ricercatori dell'argomento, è generalmente considerato ancora nelle fasi iniziali.
Sarà necessaria ulteriore ricerca per determinare i benefici dell'approccio nello sviluppo di sistemi AI più grandi. Un documento tecnico che dettaglia il concetto mHC è stato rilasciato la scorsa settimana ed è co-autore da Liang Wenfeng, fondatore e CEO di DeepSeek.
DeepSeek ripensa il design della rete per scalare l'AI
Uno dei componenti principali del lavoro è una rivalutazione di come le informazioni vengono trasferite tra i vari strati di una rete neurale multistrato.
Ogni strato in una rete neurale trasmette una forma di informazioni elaborate allo strato successivo nel modello, creando ciò che è stato definito 'Residual Learning Network' (ResNet). Sviluppato da Kaiming He di Microsoft Research e altri circa dieci anni fa, ResNet ha fornito la base fondamentale per molti dei sistemi AI più avanzati di oggi.
Un concetto sviluppato da DeepSeek è stato creato dopo che ByteDance ha introdotto Hyper-Connections nel 2024. Le Hyper-Connections permettono alle informazioni di viaggiare su più percorsi attraverso una rete, anziché su un solo percorso principale, il che può aumentare la velocità di apprendimento e la ricchezza dell'esperienza.
Tuttavia, sebbene possano essere benefici, possono anche portare a occorrenze di addestramento problematiche, in cui i modelli sperimentano instabilità di addestramento o fallimento completo.
Secondo Song Linqi (City University of Hong Kong), la ricerca di DeepSeek è una progressione di un'idea esistente, una continuazione di come DeepSeek guarda al lavoro di altre aziende, invece di inventare qualcosa da zero.
ResNet è paragonato a un'autostrada a corsia unica mentre le Hyper-Connections assomigliano a un'autostrada a più corsie; tuttavia, Song ha avvertito che avere più corsie senza regole adeguate può portare a più collisioni.
Il professor Guo Song della Hong Kong University of Science and Technology crede che questo documento di ricerca possa indicare un cambiamento nel comportamento di ricerca per AI research. Invece di continuare a fare piccole modifiche ai progetti dei modelli esistenti, ritiene che la ricerca possa evolversi verso lo sviluppo di nuovi modelli basati su costrutti teorici.
I ricercatori testano mHC ma sollevano preoccupazioni pratiche
Sebbene ci sia eccitazione per il recente traguardo raggiunto nei test di mHC per il deep learning, gli esperti hanno sottolineato che la ricerca non è ancora completa. I test forniti da DeepSeek hanno utilizzato solo quattro percorsi di dati durante i test di modelli con 27 miliardi di parametri.
"Gli esperimenti hanno convalidato i modelli fino a 27 miliardi di parametri, ma come si comporterebbe sui modelli all'avanguardia di oggi che sono di un ordine di grandezza più grandi?"
Professor Guo Song.
I modelli AI disponibili oggi sono più grandi e tipicamente hanno centinaia di miliardi di parametri rispetto ai 30 miliardi di parametri che erano lo standard solo pochi anni fa.
Guo ha fatto eco a questi sentimenti e ha dichiarato che nessuno può ancora concludere se mHC sarà in grado di eseguire lavori all'avanguardia della tecnologia AI. Ha anche dichiarato che l'infrastruttura necessaria per far funzionare mHC potrebbe essere troppo avanzata per le piccole istituzioni di ricerca da utilizzare e per le aziende da utilizzare sui dispositivi mobili.
Secondo Cryptopolitan, la popolarità di DeepSeek è arrivata dal rilascio del modello linguistico di grandi dimensioni DeepSeek V3, e dal successivo rilascio del loro modello di ragionamento DeepSeek-R1 solo un paio di settimane dopo.
Confrontando i risultati dei modelli con i loro competitor durante i test di benchmark, entrambi i modelli sono stati in grado di raggiungere o superare i risultati dei loro competitor nonostante siano stati rilasciati utilizzando solo una frazione dei dati di addestramento utilizzati per gli altri modelli linguistici concorrenti.
Non limitarti a leggere le notizie sulle criptovalute. Comprendile. Iscriviti alla nostra newsletter. È gratuita.
Enacy Mapakame
Enacy Mapakame è una giornalista con oltre 10 anni di esperienza nel settore delle notizie finanziarie e aziendali. Si occupa di mercati dei capitali e tecnologie emergenti: metaverso, intelligenza artificiale e criptovalute. Enacy è laureata con onori in Media and Society Studies.















