Amazon、AWS上でAIモデルを加速するためにCerebrasウェーハースケールチップを採用

-
Amazon Web Servicesは、長期にわたるAI推論契約に基づき、データセンターにCerebrasチップを展開する予定である。
-
この構成では、Amazon Bedrock上でAmazon Trainiumサーバー、Cerebras CS-3システム、EFAネットワークが組み合わされる。
-
Amazonは、AI応答の速度向上のため、Trainiumをプリフィルに、Cerebrasをデコードに使用する。
Amazon Web Servicesは金曜日、AI推論に焦点を当てた多年間のパートナーシップの下、自社のデータセンター内にCerebrasのプロセッサを設置すると発表しました。
この取引により、AmazonはAIモデルがプロンプトに答える、コードを書く、ライブユーザーリクエストを処理する速度を上げる新しい方法を得ました。AWSは、推論タスクにCerebrasの技術、ウェーハースケールエンジンを含むものを使用すると述べました。
両社は財務条件を共有しませんでした。この構成はAWSデータセンター内のAmazon Bedrock向けに計画されており、パートナーシップはAmazonの主要なAI製品の1つの中に直接配置されます。
AWSは、システムがAmazon Trainium搭載サーバー、Cerebras CS-3システム、およびAmazonのElastic Fabric Adapterネットワークを組み合わせると述べました。
今年後半、AWSはまた、主要なオープンソース大規模言語モデルおよびAmazon NovaをCerebrasハードウェアで提供することを計画しています。AWSのComputeおよびML Services担当副社長であるDavid Brown氏は、速度は依然としてAI推論、特にリアルタイムのコード支援やインタラクティブアプリにおける主要な問題だと述べました。
David氏は、「推論はAIが顧客に真の価値を提供する場所ですが、速度はリアルタイムのコード支援やインタラクティブアプリケーションなどの要求の高いワークロードにとって依然として重要なボトルネックです」と述べました。
Amazon、プリフィルとデコードを別々のチップに分割
AWSは、この設計が推論非集約と呼ばれる方法を使用していると述べました。これは、AI推論を2つの部分に分割することを意味します。最初の部分はプロンプト処理、つまりプリフィルです。2番目の部分は出力生成、つまりデコードです。
AWSは、2つのジョブは非常に異なる挙動を示すと述べました。プリフィルは並列処理で計算集約型であり、中程度のメモリ帯域幅を必要とします。デコードは逐次処理で計算負荷が軽く、メモリ帯域幅に大きく依存します。デコードはこれらの場合、時間の大部分を占めます。なぜなら、すべての出力トークンを1つずつ生成しなければならないからです。
そのため、AWSは各ステージに異なるハードウェアを割り当てています。Trainiumがプリフィルを処理し、Cerebras CS-3がデコードを処理します。
AWSは、低遅延・高帯域幅のEFAネットワークが両側を接続し、各プロセッサが個別のタスクに集中しながらシステムが1つのサービスとして機能できるようにすると述べました。
David氏は、「Cerebrasと構築しているものは、これを解決します:推論ワークロードをTrainiumとCS-3に分割し、AmazonのElastic Fabric Adapterで接続することで、各システムは得意なことを実行します。その結果、今日の利用可能なものよりも桁違いに高速で高性能な推論が実現します」と述べました。
AWSはまた、このサービスがAWS Nitro System上で実行されると述べました。これは、クラウドインフラストラクチャの基盤層です。
つまり、Cerebras CS-3システムとTrainium搭載インスタンスは、AWSの顧客がすでに使用しているのと同じセキュリティ、分離、一貫性で運用されることが期待されています。
Nvidiaが別の脅威に直面する中、AmazonはTrainiumをさらに強化
この発表は、AmazonがNvidia、AMD、その他の大手チップ企業に対してTrainiumを推進するための別の機会も与えます。AWSは、Trainiumをトレーニングと推論全体でスケーラブルなパフォーマンスとコスト効率のために構築された社内AIチップと説明しています。
AWSは、2つの主要なAIラボがすでにこれにコミットしていると述べました。AnthropicはAWSを主要なトレーニングパートナーとして指定し、Trainiumを使用してモデルのトレーニングとデプロイを行っています。OpenAIは、Stateful Runtime Environment、フロンティアモデル、その他の高度なワークロードのために、AWSインフラストラクチャを通じてTrainium容量の2ギガワットを消費します。
AWSは、Trainium3が最近のリリース以来強力な採用を示しており、業界全体で顧客が主要な容量にコミットしていると付け加えました。
Cerebrasは、構成のデコード側を処理しています。AWSは、CS-3がデコードの加速に専念しており、これにより高速な出力トークン用のより多くの余裕が生まれると述べました。Cerebrasは、CS-3が世界で最も高速なAI推論システムであり、最速のGPUよりも数千倍大きなメモリ帯域幅を提供すると述べています。
同社は、推論モデルが現在推論ワークロードのより大きな割合を占め、問題を解決するにつれてリクエストあたりに生成されるトークン数が増加していると述べました。Cerebrasはまた、OpenAI、Cognition、Mistralなどが、特にエージェント型コーディングなどの要求の高いワークロードに自社のシステムを使用していると述べました。
Cerebras Systemsの創設者兼CEOであるAndrew Feldman氏は、「AWSとパートナーシップを結び、非集約型推論ソリューションを構築することで、世界規模の顧客ベースに最速の推論をもたらします」と述べました。
Andrew氏はさらに、「世界中のすべての企業が、既存のAWS環境内で驚くほど高速な推論の恩恵を受けることができます」と付け加えました。
この取引は、12月にGroqと200億ドルのライセンス契約を締結し、来週Groqの技術を使用した新しい推論システムを発表する予定のNvidiaにさらなる圧力をかけます。
これをお読みいただいているあなたは、すでに一歩先を行っています。当社のニュースレターでその先を行ってください。

Jai Hamid
ジャイ・ハミドは、過去6年間、暗号通貨、株式市場、テクノロジー、世界経済、そして市場に影響を与える地政学的イベントを報道してきました。彼女は、AMB Crypto、Coin Edition、CryptoTaleなどのブロックチェーン専門出版物で、市場分析、大手企業、規制、マクロ経済動向に関する記事を担当してきました。ロンドン・スクール・オブ・ジャーナリズムを卒業し、アフリカ有数のテレビネットワークで3回にわたり暗号通貨市場の洞察を提供しています。
















