La previsione multi-token aumenta la velocità del modello IA di tre volte, afferma Meta

- Uno studio di ricerca condotto da esperti di meta-ricerca dimostra che le previsioni multi-token possono migliorare le prestazioni dei LLM.
- La tecnica prevede l'utilizzo di più teste di output per effettuare previsioni simultaneamente.
- Non comporta costi aggiuntivi in termini di memoria o tempo, poiché il processo utilizza la stessa architettura di inferenza di base.
L'addestramento dei modelli linguistici per prevedere più token contemporaneamente risulta in una migliore efficienza del campione, affermano i ricercatori di Meta.
I grandi modelli linguistici come Llama e ChatGPT sono solitamente addestrati per la previsione del token successivo, ma con questo nuovo approccio è possibile ottenere prestazioni migliori.
Cos'è la tecnica di previsione del token singolo?
La tecnica di previsione multi-token fornisce un vantaggio significativo in alcuni scenari con una velocità tre volte superiore rispetto alle attività generative, ma non è ancora una soluzione unica per ogni tipo di modello. La tecnica ha ancora molto spazio per il miglioramento e, per alcune applicazioni LLM, può diventare uno strumento robusto.
Per una comprensione più chiara, si può dire che il processo tradizionale per l'addestramento LLM utilizza un approccio chiamato “previsione del token successivo”, e in questo modo, un modello prevede solo il prossimo token futuro in una data sequenza.
In un processo automatizzato, il token previsto viene aggiunto all'input e il processo viene ripetuto più e più volte su tutto l'input di testo fornito in modo che il modello impari i modelli comuni e sviluppi la capacità di produrre output costituiti da testo logico e coerente.
Ci sono alcuni svantaggi di questa tecnica, poiché elaborando solo il token successivo, il modello diventa troppo focalizzato sui modelli locali nel testo e ignora le previsioni che possono essere fatte solo con il ragionamento.
Un altro problema con questa tecnica è che richiede enormi quantità di dataset da alimentare nel modello per raggiungere il flusso normale dell'output linguistico che gli umani possono fare con molto poco testo.
La previsione multi-token abilita la velocità 3X

Nel nuovo approccio multi-token suggerito da Meta, il LLM è istruito per prevedere più token da posizioni diverse contemporaneamente durante il processo di addestramento. I ricercatori hanno utilizzato una semplice architettura di previsione per la previsione multi-token che non richiede risorse aggiuntive come tempo e elaborazione della memoria.
I ricercatori hanno utilizzato la stessa architettura Transformer già utilizzata dalla maggior parte dei LLM, ma hanno apportato alcune modifiche per accommodare la previsione multi-token aumentando le sue teste di output da singole a multiple e assegnandone una a ciascun token.
In questo modo, per trarre conclusioni e fare previsioni, il modello utilizza la stessa strategia di previsione di base, ma utilizzando più teste, può accelerare il processo. Lo studio di ricerca afferma:
“Sebbene gratuita e semplice, la previsione multi-token è una modifica efficace per addestrare modelli transformer più forti e veloci.”
Fonte: Meta.
I ricercatori hanno trovato durante lo studio che la tecnica ha prodotto risultati subottimali quando l'hanno utilizzata su modelli più piccoli, ma i risultati sono diventati migliori della media quando hanno applicato lo stesso processo a modelli più grandi, e i risultati hanno continuato a migliorare con la dimensione del modello. Come scrive lo studio:
“Il metodo è sempre più utile per dimensioni di modello più grandi e mantiene il suo fascino quando si addestra per più epoche. I guadagni sono particolarmente pronunciati nei benchmark generativi come la codifica, dove i nostri modelli superano costantemente le basi forti di diversi punti percentuali.”
Fonte: Meta.
I ricercatori hanno anche detto che la tecnica di previsione multi-token rende il modello tre volte più veloce nel produrre risultati logici, il che è utile con il beneficio di nessun o molto poco costo aggiuntivo.
Non limitarti a leggere le notizie sulle criptovalute. Comprendile. Iscriviti alla nostra newsletter. È gratuita.
Dichiarazione di responsabilità. Le informazioni fornite non costituiscono consigli di trading. Cryptopolitan.com non si assume alcuna responsabilità per eventuali investimenti effettuati sulla base delle informazioni fornite in questa pagina. Si consiglia vivamente di effettuare ricerche indipendenti e/o consultare un professionista qualificato prima di prendere qualsiasi decisione di investimento.

Aamir Sheikh
Aamir è un giornalista tecnologico con quasi sei anni di esperienza nei settori delle criptovalute e della tecnologia. Si è laureato presso l'Università MAJ con un MBA in Finanza e Marketing. Attualmente lavora per Cryptopolitan, dove si occupa delle ultime novità sui mercati delle criptovalute e delle previsioni sui prezzi.
















