Многопоточное предсказание увеличивает скорость ИИ-модели в три раза, утверждает Meta

- Исследование исследователей Meta показывает, что прогнозирование нескольких токенов может повысить производительность LLM.
- Техника предполагает использование нескольких выходных головок для одновременного выполнения прогнозов.
- Это не требует дополнительных затрат памяти или времени, так как процесс использует ту же базовую архитектуру вывода.
Большие языковые модели, такие как Llama и ChatGPT, обычно обучаются для предсказания следующего токена, но с этим новым подходом можно достичь лучшей производительности.
Что такое техника предсказания одного токена?
Техника многопоточного предсказания обеспечивает значительное преимущество в некоторых сценариях, увеличивая скорость генеративных задач в три раза, но она все еще не является универсальным решением для каждого типа модели. У этой техники есть значительный потенциал для улучшения, и для некоторых приложений LLM она может стать надежным инструментом.
Для более четкого понимания можно сказать, что традиционный процесс обучения LLM использует подход, называемый «предсказанием следующего токена», и таким образом модель предсказывает только один будущий токен в данной последовательности.
В автоматическом процессе предсказанный токен добавляется к входу, и процесс повторяется снова и снова по всему предоставленному текстовому входу, чтобы модель изучала общие закономерности и развивала способность генерировать вывод, состоящий из логичного и последовательного текста.
У этой техники есть некоторые недостатки: обрабатывая только следующий токен, модель становится слишком сосредоточенной на локальных паттернах в тексте и игнорирует предсказания, которые можно сделать только с помощью рассуждений.
Еще одна проблема этой техники заключается в том, что для достижения нормального потока языкового вывода, который люди могут сделать с очень небольшим количеством текста, требуется огромное количество наборов данных для подачи в модель.
Многопоточное предсказание обеспечивает скорость ⟦N1⟧X
Мультитокеновое предсказание обеспечивает скорость 3X

В новом подходе с несколькими токенами, предложенном Meta, LLM инструктируется предсказывать несколько токенов из разных позиций одновременно в процессе обучения. Исследователи использовали простую архитектуру предсказания для многопоточного прогнозирования, которая не требует дополнительных ресурсов, таких как время и память.
Таким образом, для вывода заключений и предсказаний модель использует ту же базовую стратегию следующего предсказания, но, используя несколько головок, она может ускорить процесс. В исследовательской работе говорится:
«Хотя и бесплатная, и простая, многопоточная предсказательная техника является эффективным изменением для обучения более сильных и быстрых трансформерных моделей».
Исследователи обнаружили во время исследования, что техника давала посредственные результаты, когда они применяли ее к меньшим моделям, но результаты стали лучше средних, когда они применили тот же процесс к большим моделям, и результаты продолжали улучшаться с размером модели. Как говорится в исследовании:
Исследователи использовали ту же архитектуру Transformer, которая уже используется большинством LLM, но внесли некоторые изменения, чтобы accommodate многопоточное предсказание, увеличив количество выходных головок с одной до нескольких и выделив по одной на каждый токен.
«Метод становится все более полезным для больших размеров моделей и сохраняет свою привлекательность при обучении в течение нескольких эпох. Прирост особенно заметен на генеративных бенчмарках, таких как программирование, где наши модели последовательно превосходят сильные базовые линии на несколько процентных пунктов».
Исследователи также заявили, что техника многопоточного предсказания делает модель в три раза быстрее при генерации логичных результатов, что полезно при отсутствии или очень небольшой дополнительной стоимости.
Источник: Meta.
Обучение языковых моделей предсказывать несколько токенов одновременно приводит к лучшей эффективности выборки, утверждают исследователи из Meta. Большие языковые модели, такие как Llama и ChatGPT, обычно обучаются для предсказания следующего токена, но с этим новым подходом можно достичь лучшей производительности. Что такое техника предсказания одного токена? Техника многопоточного предсказания обеспечивает…
Самые умные крипто-энтузиасты уже читают нашу рассылку. Хотите присоединиться? Присоединяйтесь.
Отказ от ответственности. Предоставленная информация не является торговой рекомендацией. Cryptopolitan.com Мы не несем ответственности за любые инвестиции, сделанные на основе информации, представленной на этой странице. Мы настоятельно рекомендуем проводить независимое исследование и/или проконсультироваться с квалифицированным специалистом перед принятием любых инвестиционных решений.

Амир Шейх
Амир — технологический журналист с почти шестилетним опытом работы в индустриях криптовалют и технологий. Он окончил университет MAJ, получив степень MBA по финансам и маркетингу. Сейчас он работает в Cryptopolitan, где освещает последние события на рынке криптовалют и прогнозы цен.
















