Amazon использует чипы Cerebras wafer-scale для ускорения ИИ-моделей на AWS

-
Amazon Web Services развернёт чипы Cerebras в своих дата-центрах в рамках многолетнего соглашения по инференсу ИИ.
-
Инфраструктура объединяет серверы Amazon Trainium, системы Cerebras CS-3 и сеть EFA в рамках Amazon Bedrock.
-
Amazon будет использовать Trainium для этапа префилла, а Cerebras — для декодирования, чтобы ускорить ответы ИИ.
Amazon Web Services объявила в пятницу, что разместит процессоры от Cerebras в своих центрах обработки данных в рамках многолетнего партнерства, ориентированного на ИИ-вывод.
Сделка дает Amazon новый способ ускорить работу ИИ-моделей при ответе на запросы, написании кода и обработке живых пользовательских запросов. AWS заявила, что будет использовать технологию Cerebras, включая Wafer-Scale Engine, для задач вывода.
Компании не раскрыли финансовые условия. Настройка планируется для Amazon Bedrock внутри центров обработки данных AWS, что размещает партнерство прямо внутри одного из основных ИИ-продуктов Amazon.
AWS заявила, что система будет объединять серверы на базе Amazon Trainium, системы Cerebras CS-3 и сетевую инфраструктуру Amazon Elastic Fabric Adapter.
В конце этого года AWS также планирует предложить ведущие открытые большие языковые модели и Amazon Nova на оборудовании Cerebras. Дэвид Браун, вице-президент по вычислительным услугам и машинному обучению в AWS, отметил, что скорость по-прежнему является серьезной проблемой в ИИ-выводе, особенно для помощи в программировании в реальном времени и интерактивных приложений.
Дэвид сказал: «Вывод — это то место, где ИИ приносит реальную ценность клиентам, но скорость остается критическим узким местом для требовательных рабочих нагрузок, таких как помощь в программировании в реальном времени и интерактивные приложения».
Amazon разделяет префилл и декодирование на отдельные чипы
AWS заявила, что дизайн использует метод, называемый диссоциацией вывода (inference disaggregation). Это означает разделение ИИ-вывода на две части. Первая часть — обработка запроса, также называемая префиллом. Вторая часть — генерация вывода, также называемая декодированием.
AWS заявила, что эти две задачи ведут себя очень по-разному. Префилл является параллельным, требует больших вычислительных мощностей и умеренной пропускной способности памяти. Декодирование является последовательным, менее требовательно к вычислениям и гораздо больше зависит от пропускной способности памяти. Декодирование также занимает большую часть времени в этих случаях, поскольку каждый выводимый токен должен быть сгенерирован по одному.
Именно поэтому AWS назначает разное оборудование для каждого этапа. Trainium будет обрабатывать префилл. Cerebras CS-3 будет обрабатывать декодирование.
AWS заявила, что сеть EFA с низкой задержкой и высокой пропускной способностью соединит обе стороны, чтобы система работала как единый сервис, в то время как каждый процессор фокусируется на отдельной задаче.
Дэвид сказал: «То, что мы строим с Cerebras, решает эту проблему: разделяя рабочую нагрузку по выводу между Trainium и CS-3 и соединяя их с помощью Amazon Elastic Fabric Adapter, каждая система делает то, что у нее получается лучше всего. Результатом станет вывод, который на порядок быстрее и имеет более высокую производительность, чем то, что доступно сегодня».
AWS также заявила, что сервис будет работать на базе AWS Nitro System, которая является базовым слоем ее облачной инфраструктуры.
Это означает, что ожидается, что системы Cerebras CS-3 и инстансы на базе Trainium будут работать с той же безопасностью, изоляцией и согласованностью, которые уже используют клиенты AWS.
Amazon активнее продвигает Trainium, пока Nvidia сталкивается с новой угрозой
Это объявление также дает Amazon еще одну возможность продвигать Trainium против чипов от Nvidia, AMD и других крупных производителей полупроводников. AWS описывает Trainium как собственный ИИ-чип, разработанный для масштабируемой производительности и экономической эффективности как при обучении, так и при выводе моделей.
AWS заявила, что два крупных ИИ-лаборатории уже взяли на себя обязательства. Anthropic назвала AWS своим основным партнером по обучению и использует Trainium для обучения и развертывания моделей. OpenAI будет потреблять 2 гигаватта мощности Trainium через инфраструктуру AWS для Stateful Runtime Environment, моделей передового уровня и других сложных рабочих нагрузок.
AWS добавила, что Trainium3 демонстрирует сильный рост внедрения с момента недавнего выпуска, при этом клиенты из различных отраслей берут на себя значительные объемы мощности.
Cerebras обрабатывает сторону декодирования в этой настройке. AWS заявила, что CS-3 предназначен для ускорения декодирования, что дает ему больше возможностей для быстрой генерации выводимых токенов. Cerebras утверждает, что CS-3 — самая быстрая в мире система ИИ-вывода и обеспечивает пропускную способность памяти в тысячи раз большую, чем у самых быстрых GPU.
Компания заявила, что модели рассуждения теперь составляют большую долю рабочих нагрузок по выводу и генерируют больше токенов на запрос, поскольку они решают задачи. Cerebras также заявила, что OpenAI, Cognition, Mistral и другие используют ее системы для требовательных рабочих нагрузок, особенно в области агентного программирования.
Эндрю Фельдман, основатель и генеральный директор Cerebras Systems, сказал: «Партнерство с AWS для создания диссоциированного решения для вывода обеспечит самый быстрый вывод для глобальной базы клиентов».
Эндрю добавил: «Каждое предприятие по всему миру сможет воспользоваться преимуществами невероятно быстрого вывода в своей существующей среде AWS».
Сделка оказывает дополнительное давление на Nvidia, которая в декабре подписала лицензионное соглашение на сумму 20 миллиардов долларов с Groq и планирует на следующей неделе представить новую систему вывода с использованием технологии Groq.
Самые умные крипто-энтузиасты уже читают нашу рассылку. Хотите присоединиться? Присоединяйтесь.

Джай Хамид
Джай Хамид последние 6 лет освещает криптовалюты, фондовые рынки, технологии, мировую экономику и геополитические события, влияющие на рынки. Она работала с изданиями, сфокусированными на блокчейне, включая AMB Crypto, Coin Edition и CryptoTale, над рыночными аналитическими материалами, обзорами крупных компаний, регулированием и макроэкономическими трендами. Окончила Лондонскую школу журналистики и трижды выступала с аналитическими обзорами криптовалютного рынка на одном из ведущих телеканалов Африки.
















