DERNIÈRES ACTUALITÉS
SÉLECTIONNÉ POUR VOUS

La prédiction multi-jeton augmente la vitesse des modèles d'IA de trois fois, selon Meta

ParAamir SheikhAamir Sheikh 2 min de lecture
Prédiction multi-jetons
  • Une étude de recherche menée par des chercheurs de Meta montre que les prédictions multi-jetons peuvent améliorer les performances des LLM.
  • Cette technique consiste à utiliser plusieurs têtes de sortie pour effectuer des prédictions simultanément.
  • Elle ne nécessite aucun coût supplémentaire en mémoire ou en temps, car le processus utilise la même architecture d'inférence de base.

L'entraînement des modèles de langage à prédire plusieurs jetons à la fois améliore l'efficacité de l'échantillonnage, affirment les chercheurs de Meta.

Les grands modèles de langage comme Llama et ChatGPT sont généralement entraînés pour la prédiction du prochain jeton, mais avec cette nouvelle approche, de meilleures performances peuvent être obtenues.

Qu'est-ce que la technique de prédiction de jeton unique ?

La technique de prédiction multi-jeton offre un avantage significatif dans certains scénarios avec une vitesse trois fois supérieure pour les tâches génératives, mais elle n'est pas une solution universelle pour tous les types de modèles. La technique présente encore une marge de progression importante et, pour certaines applications de LLM, elle peut devenir un outil robuste.

Pour une compréhension plus claire, on peut dire que le processus traditionnel d'entraînement des LLM utilise une approche appelée « prédiction du prochain jeton », de sorte qu'un modèle ne prédit que le prochain jeton futur dans une séquence donnée.

Dans un processus automatisé, le jeton prédit est ajouté à l'entrée, et le processus est répété encore et encore sur l'intégralité du texte d'entrée fourni, afin que le modèle apprenne les modèles courants et développe la capacité de produire un texte logique et cohérent.

Cette technique présente quelques inconvénients : en ne traitant que le prochain jeton, le modèle se concentre trop sur les motifs locaux du texte et ignore les prédictions qui ne peuvent être faites qu'avec du raisonnement.

Un autre problème avec cette technique est qu'elle nécessite d'énormes quantités de jeux de données à alimenter dans le modèle pour atteindre le flux normal de sortie linguistique que les humains peuvent produire avec très peu de texte.

La prédiction multi-jeton permet une vitesse 3

Source : Meta.

Dans la nouvelle approche multi-jeton suggérée par Meta, le LLM est instruit de prédire plusieurs jetons provenant de différentes positions simultanément lors du processus d'entraînement. Les chercheurs ont utilisé une architecture de prédiction simple pour la prédiction multi-jeton qui ne nécessite pas de ressources supplémentaires telles que du temps ou de la mémoire de traitement.

Les chercheurs ont utilisé la même architecture Transformer déjà utilisée par la plupart des LLM, mais ils ont apporté quelques modifications pour accommoder la prédiction multi-jeton en augmentant ses têtes de sortie d'une à multiples et en en attribuant une à chaque jeton.

De cette manière, pour tirer des conclusions et faire des prédictions, le modèle utilise la même stratégie de prédiction de base, mais en utilisant plusieurs têtes, il peut accélérer le processus. L'étude de recherche indique :

« Bien que gratuite et simple, la prédiction multi-jeton est une modification efficace pour entraîner des modèles Transformer plus puissants et plus rapides. »

Source : Meta.

Les chercheurs ont constaté lors de l'étude que la technique produisait des résultats médiocres lorsqu'elle était appliquée à des modèles plus petits, mais les résultats sont devenus meilleurs que la moyenne lorsqu'ils ont appliqué le même processus à des modèles plus grands, et les résultats continuaient de s'améliorer avec la taille du modèle. Comme l'écrit l'étude :

« La méthode est de plus en plus utile pour les tailles de modèles plus grandes, et conserve son attrait lors de l'entraînement sur plusieurs époques. Les gains sont particulièrement prononcés sur les benchmarks génératifs comme la programmation, où nos modèles surpassent constamment les bases solides de plusieurs points de pourcentage. »

Source : Meta.

Les chercheurs ont également déclaré que la technique de prédiction multi-jeton rend le modèle trois fois plus rapide pour produire des résultats logiques, ce qui est utile avec l'avantage d'un coût supplémentaire nul ou très faible.

Si vous lisez ceci, vous êtes déjà en avance. Restez ainsi grâce à notre newsletter.

Partager cet article

Avertissement. Les informations fournies ne constituent pas des conseils en matière d'investissement. Cryptopolitan.com ne saurait être tenue responsable des investissements réalisés sur la base des informations fournies sur cette page. Nous recommandons vivement de mener vos propres recherches et/ou de consulter un professionnel qualifié avant de prendre toute décision d'investissement.

Aamir Sheikh

Aamir Sheikh

Aamir est journaliste technologique avec près de six ans d'expérience dans les secteurs de la cryptomonnaie et de la technologie. Il est diplômé de l'université MAJ avec un MBA en finance et marketing. Il travaille désormais pour Cryptopolitan, où il rend compte des dernières évolutions des marchés de la cryptomonnaie et des prévisions de prix.

PLUS D'ACTUALITÉS…