ÚLTIMAS NOTICIAS
SELECCIONADO PARA TI

La predicción de múltiples tokens aumenta la velocidad del modelo de IA tres veces, dice Meta

PorAamir SheikhAamir Sheikh 2 min de lectura
Predicción de múltiples tokens
  • Un estudio de investigación realizado por investigadores de meta muestra que las predicciones de múltiples tokens pueden aumentar el rendimiento de los LLM.
  • La técnica implica el uso de múltiples cabezas de salida para realizar predicciones simultáneamente.
  • No requiere costos adicionales en memoria o tiempo, ya que el proceso utiliza la misma arquitectura básica de inferencia.

Entrenar modelos de lenguaje para predecir múltiples tokens a la vez resulta en una mejor eficiencia de muestra, dicen investigadores de Meta.

Los modelos de lenguaje grandes como Llama y ChatGPT suelen entrenarse para la predicción del siguiente token, pero con este nuevo enfoque, se puede lograr un mejor rendimiento.

¿Qué es la técnica de predicción de un solo token?

La técnica de predicción de múltiples tokens proporciona una ventaja significativa en algunos escenarios con tres veces la velocidad de las tareas generativas, pero aún no es una solución única para todos los tipos de modelos. La técnica tiene bastante margen de mejora y, para algunas aplicaciones de LLM, puede convertirse en una herramienta robusta.

Para una comprensión más clara, se puede decir que el proceso tradicional para el entrenamiento de LLM utiliza un enfoque llamado "predicción del siguiente token", y de esta manera, un modelo predice solo el siguiente token futuro en una secuencia dada.

En un proceso automatizado, el token que predijo se agrega a la entrada, y el proceso se repite una y otra vez sobre toda la entrada de texto proporcionada para que el modelo aprenda los patrones comunes y desarrolle la capacidad de producir salida que consista en texto lógico y coherente.

Existen algunas desventajas de esta técnica, ya que al procesar solo el siguiente token, el modelo se vuelve demasiado enfocado en los patrones locales del texto e ignora las predicciones que solo se pueden hacer con razonamiento.

Otro problema con esta técnica es que requiere grandes cantidades de conjuntos de datos para ser alimentados al modelo para alcanzar el flujo normal de salida de lenguaje que los humanos pueden hacer con muy poco texto.

La predicción de múltiples tokens permite 3X velocidad

Fuente: Meta.

En el nuevo enfoque de múltiples tokens sugerido por Meta, el LLM se instruye para predecir múltiples tokens desde diferentes posiciones al mismo tiempo en el proceso de entrenamiento. Los investigadores utilizaron una arquitectura de predicción simple para la predicción de múltiples tokens que no requiere recursos adicionales como tiempo y procesamiento de memoria.

Los investigadores utilizaron la misma arquitectura Transformer que ya es utilizada por la mayoría de los LLM, pero hicieron algunos cambios para acomodar la predicción de múltiples tokens aumentando sus cabezales de salida de uno a múltiples y asignando uno a cada token.

De esta manera, para sacar conclusiones y hacer predicciones, el modelo utiliza la misma estrategia básica de predicción siguiente, pero al utilizar múltiples cabezales, puede acelerar el proceso. El estudio de investigación dice,

"Aunque es gratuita y simple, la predicción de múltiples tokens es una modificación efectiva para entrenar modelos transformadores más fuertes y rápidos."

Fuente: Meta.

Los investigadores encontraron durante el estudio que la técnica produjo resultados subóptimos cuando la usaron en modelos más pequeños, pero los resultados fueron mejores que el promedio cuando aplicaron el mismo proceso a modelos más grandes, y los resultados siguieron mejorando con el tamaño del modelo. Como escribe el estudio,

"El método es cada vez más útil para tamaños de modelo más grandes, y mantiene su atractivo cuando se entrena durante múltiples épocas. Las ganancias son especialmente pronunciadas en benchmarks generativos como la codificación, donde nuestros modelos superan consistentemente a las bases fuertes en varios puntos porcentuales."

Fuente: Meta.

Los investigadores también dijeron que la técnica de predicción de múltiples tokens también hace que el modelo sea tres veces más rápido al producir resultados lógicos, lo cual es útil con el beneficio de no o muy poco costo adicional.

Si estás leyendo esto, ya vas por delante. Mantente así con nuestro boletín.

Comparte este artículo

Aviso de responsabilidad. La información proporcionada no es un consejo de trading. Cryptopolitan.com no asumimos responsabilidad alguna por las inversiones realizadas basándose en la información proporcionada en esta página. Recomendamos encarecidamente la investigación independiente y/o la consulta con un profesional calificado antes de tomar cualquier decisión de inversión.

Aamir Sheikh

Aamir Sheikh

Aamir es un periodista tecnológico con casi seis años de experiencia en los sectores de criptomonedas y tecnología. Se graduó de la Universidad MAJ con un MBA en Finanzas y Marketing. Ahora trabaja con Cryptopolitan, donde informa sobre los últimos desarrollos en los mercados de criptomonedas y predicciones de precios.

MÁS … NOTICIAS