AKTUELLE NACHRICHTEN
FÜR SIE AUSGEWÄHLT

Multi-Token-Vorhersage erhöht die Geschwindigkeit von KI-Modellen um das Dreifache, sagt Meta

VonAamir SheikhAamir Sheikh 2 Min. Lesezeit
Multi-Token-Vorhersage
  • Eine Forschungsstudie von Meta-Rechercheuren zeigt, dass Multi-Token-Vorhersagen die Leistung von LLMs steigern können.
  • Die Technik beinhaltet die Verwendung mehrerer Ausgabeköpfe, um gleichzeitig Vorhersagen zu treffen.
  • Sie erfordert keine zusätzlichen Kosten für Speicher oder Zeit, da der Prozess dieselbe grundlegende Inferenzarchitektur nutzt.

Das Training von Sprachmodellen zur gleichzeitigen Vorhersage mehrerer Token führt zu einer besseren Stichprobeneffizienz, so Forscher von Meta.

Große Sprachmodelle wie Llama und ChatGPT werden normalerweise für die Vorhersage des nächsten Tokens trainiert, aber mit diesem neuen Ansatz kann eine bessere Leistung erzielt werden.

Was ist die Technik der Einzel-Token-Vorhersage?

Die Multi-Token-Vorhersagetechnik bietet in einigen Szenarien einen erheblichen Vorteil mit der dreifachen Geschwindigkeit generativer Aufgaben, ist jedoch keine Allzwecklösung für jede Art von Modell. Die Technik hat noch erheblichen Verbesserungsbedarf, und für einige LLM-Anwendungen kann sie zu einem robusten Werkzeug werden.

Um ein klareres Verständnis zu ermöglichen, lässt sich sagen, dass der traditionelle Prozess für das LLM-Training einen Ansatz namens „Next-Token-Prediction“ (Vorhersage des nächsten Tokens) verwendet, bei dem ein Modell nur das nächste zukünftige Token in einer gegebenen Sequenz vorhersagt.

In einem automatisierten Prozess wird das vorhergesagte Token zur Eingabe hinzugefügt, und der Vorgang wird immer wieder über die gesamte bereitgestellte Texteingabe hinweg wiederholt, sodass das Modell die gemeinsamen Muster lernt und die Fähigkeit entwickelt, Ausgaben zu erzeugen, die aus logischem und konsistentem Text bestehen.

Es gibt einige Nachteile bei dieser Technik, da das Modell durch die Verarbeitung nur des nächsten Tokens zu sehr auf lokale Muster im Text fokussiert ist und Vorhersagen ignoriert, die nur durch Schlussfolgerungen getroffen werden können.

Ein weiteres Problem mit dieser Technik ist, dass sie enorme Datenmengen erfordert, die in das Modell eingespeist werden müssen, um den normalen Fluss der sprachlichen Ausgabe zu erreichen, den Menschen mit sehr wenig Text bewältigen können.

Multi-Token-Vorhersage ermöglicht 3X-Geschwindigkeit

Quelle: Meta.

In dem von Meta vorgeschlagenen neuen Multi-Token-Ansatz wird das LLM angewiesen, während des Trainingsprozesses mehrere Token an verschiedenen Positionen gleichzeitig vorherzusagen. Die Forscher verwendeten eine einfache Vorhersagearchitektur für die Multi-Token-Vorhersage, die keine zusätzlichen Ressourcen wie Zeit- und Speicherverarbeitung erfordert.

Die Forscher verwendeten die gleiche Transformer-Architektur, die bereits von den meisten LLMs genutzt wird, nahmen jedoch einige Änderungen vor, um die Mehrfach-Token-Vorhersage zu ermöglichen, indem sie die Ausgabeköpfe von einem auf mehrere erhöhten und jedem Token einen zugeordnet haben.

Auf diese Weise verwendet das Modell für Schlussfolgerungen und Vorhersagen dieselbe grundlegende nächste Vorhersagestrategie, kann den Prozess jedoch durch die Nutzung mehrerer Köpfe beschleunigen. Die Forschungsstudie besagt:

„Obwohl kostenfrei und einfach, ist die Multi-Token-Vorhersage eine effektive Modifikation, um stärkere und schnellere Transformer-Modelle zu trainieren.“

Quelle: Meta.

Die Forscher stellten während der Studie fest, dass die Technik bei kleineren Modellen unterdurchschnittliche Ergebnisse lieferte, die Ergebnisse jedoch besser als durchschnittlich wurden, als sie denselben Prozess auf größere Modelle anwendeten, und die Ergebnisse verbesserten sich weiter mit der Größe des Modells. Wie die Studie schreibt:

„Die Methode ist für größere Modellgrößen zunehmend nützlich und behält ihre Attraktivität beim Training über mehrere Epochen hinweg. Die Gewinne sind insbesondere bei generativen Benchmarks wie dem Programmieren ausgeprägt, bei denen unsere Modelle starke Baselines konsistent um mehrere Prozentpunkte übertreffen.“

Quelle: Meta.

Die Forscher sagten auch, dass die Multi-Token-Vorhersagetechnik das Modell bei der Erzeugung logischer Ergebnisse dreimal schneller macht, was bei keinem oder sehr geringen zusätzlichen Kosten von Vorteil ist.

Lesen Sie nicht nur Krypto-Nachrichten. Verstehen Sie sie. Abonnieren Sie unseren Newsletter. Es ist kostenlos.

Diesen Artikel teilen

Haftungsausschluss. Die bereitgestellten Informationen stellen keine Anlageberatung dar. Cryptopolitan.com Wir übernehmen keine Haftung für Investitionen, die auf den auf dieser Seite bereitgestellten Informationen basieren. Wir empfehlen dringend, vor jeglichen Anlageentscheidungen eine unabhängige Recherche durchzuführen und/oder einen qualifizierten Fachmann zu konsultieren.

Aamir Sheikh

Aamir Sheikh

Aamir ist Tech-Journalist mit fast sechs Jahren Erfahrung in der Krypto- und Technologiebranche. Er absolvierte sein Studium an der MAJ University mit einem MBA in Finanzen und Marketing. Heute arbeitet er für Cryptopolitan, wo er über die neuesten Entwicklungen in den Kryptowährungsmärkten und Preisprognosen berichtet.

MEHR … NACHRICHTEN