ULTIME NOTIZIE
SELEZIONATO PER TE

Modelli AI più piccoli superano quelli più grandi in efficienza, trova lo studio di Google

DiJohn PalmerJohn Palmer 3 min di lettura
Google
  • Modelli AI più piccoli superano quelli più grandi nella generazione di immagini, ridefinendo l'efficienza.
  • In ambito AI, più grande non è sempre meglio: lo dimostra uno studio di Google e Johns Hopkins.
  • Rivoluzionare l'AI: i modelli più piccoli aprono la strada a una tecnologia accessibile ed efficiente.

Tra tutti gli studi che hanno cercato di sistematizzare il campo dell'intelligenza artificiale (IA) e hanno lottato con la domanda se esista un punto in cui i modelli AI più piccoli possono superare quelli più grandi in efficacia, lo studio di Google Research e Johns Hopkins University ha finalmente confutato quell'argomento. Ha dimostrato che nel contesto della generazione di immagini, i modelli più piccoli tendono a performare meglio rispetto ai loro controparti più grandi. Il 2 maggio, lo studio guidato da Kangfu Mei e Zhengzhong Tu ha rivelato le proprietà di scaling dei modelli di diffusione latente (LDM). Hanno scoperto che i cambiamenti nella risoluzione dell'immagine di output non apportano alterazioni significative, tuttavia l'aumento delle dimensioni del modello può portare a miglioramenti sostanziali. 

Ripensare l'efficienza dei modelli AI

Gli studi hanno impiegato LDM da 39 milioni a 5 miliardi di parametri con varianti per attività tra cui generazione testo-immagine, super-risoluzione e super-risoluzione guidata dal soggetto, mentre i partecipanti hanno sottoposto a processi di addestramento e valutazione attentamente praticati e valutati. Il fatto provato che i modelli più piccoli reggono bene, anche se non più grandi di quelli con cui vengono confrontati, mostra che quando il calcolo è limitato, i modelli più piccoli possono persino superare quelli più grandi.

Le esplorazioni fatte da questo studio si rivelano intricate. Il primo punto degno di nota è che i piccoli modelli sono ad alte prestazioni e offrono la stessa o un'efficienza di campionamento elevata attraverso tutti i tipi di sampler di diffusione e anche dopo che la distillazione del modello è stata eseguita. 

Questa robustezza spiega quindi che la scala del chip dei modelli inferiori è integrale ai loro meriti e non è una conseguenza diretta di un algoritmo o metodo di addestramento. Tuttavia, ammette anche che i modelli più grandi possono essere utili per lo stesso scopo, specialmente nei casi in cui non sorgono problemi di allocazione delle risorse (come la potenza di calcolo) perché possono creare immagini con dettagli migliori.

Risultati chiave e implicazioni

Tali scoperte non sono solo rivoluzionarie per lo spazio tecnologico attuale, ma hanno anche conseguenze significative per lo sviluppo dell'IA. Svolgono una funzione significativa nel determinare come lo sviluppo dei sistemi IA consenta una generazione di immagini più accessibile, potente e rispettosa delle risorse in capacità di alto livello. Questo è particolarmente importante in un'epoca in cui c'è un appello crescente per lo sviluppo di un'intelligenza artificiale con apertura e accessibilità, in modo che venga portata agli sviluppatori e, alla fine, agli utenti.

È in linea con una certa tendenza della società IA che prevale oggi e fornisce prove della superiorità di modelli più piccoli come LLaMa e Falcon rispetto al resto in varie attività. 

La tendenza ad applicare codici open source, che sono efficienti in termini di velocità e risparmio energetico del dispositivo, aumenterà il livello di democrazia nel mondo dell'IA consentendo al sistema di funzionare senza richiedere sensibilità dei computer avanzati. Le ramificazioni di questo tipo di studio sono piuttosto sbalorditive, il che potrebbe portare a un cambiamento completo nel modo in cui l'IA viene applicata alle tecnologie quotidiane e rendere le soluzioni IA di alto livello disponibili a un numero maggiore di utenti.

Un cambio di paradigma

Gli studi di ricerca di Google Research e Johns Hopkins University hanno ora creato un punto critico nello sviluppo dell'IA, poiché mettono in discussione gli attuali approcci allo sviluppo dell'IA e guidano i professionisti a implementare processi IA più economici e rispettosi dell'ambiente. 

La comunità IA si sposta verso l'area di ricerca sui modelli minuscoli; questa ricerca non riassume solo tutta la comprensione attuale della prospettiva, ma fornisce anche spazio per innovazioni creative riguardo all'efficienza, alle prestazioni e alla praticità della creazione di sistemi IA.

Questo sviluppo è quindi non solo un cambio di paradigma nello sviluppo della tecnologia dell'IA, ma anche un movimento dell'industria verso l'inclusività e l'accessibilità nella tecnologia. Tra le cose che la crescente presenza dell'IA sta portando, rendere i modelli deployabili su innumerevoli dispositivi che possono performare in modo efficiente e accurato è una delle poche cose che possono far sì che l'IA abbia un raggio di applicazioni molto più ampio una volta che queste cose entreranno sul mercato. 

La novità di questo studio entra in gioco attraverso le proprietà di scaling del modello che introducono nel quadro i compromessi tra dimensioni del modello e prestazioni, rendendoli una ricerca pionieristica da condurre che promette un futuro IA più efficiente e accessibile.

Non limitarti a leggere le notizie sulle criptovalute. Comprendile. Iscriviti alla nostra newsletter. È gratuita.

Condividi questo articolo

Dichiarazione di responsabilità. Le informazioni fornite non costituiscono consigli di trading. Cryptopolitan.com non si assume alcuna responsabilità per eventuali investimenti effettuati sulla base delle informazioni fornite in questa pagina. Si consiglia vivamente di effettuare ricerche indipendenti e/o consultare un professionista qualificato prima di prendere qualsiasi decisione di investimento.

John Palmer

John Palmer

John Murangiri è arrivato su Cryptopolitan con competenze nell'analisi di mercato. John (noto anche come JP) si è laureato presso l'Università di Nairobi con una laurea in comunicazione di massa e studi sui media. In precedenza ha contribuito con approfondimenti sul mercato delle criptovalute a InsideBitcoins.com e Metacoingraph.

ALTRE NOTIZIE …