Cerebras 推出 AI 推理服务挑战英伟达

Cerebras 推出基于 Wafer Scale Engine 芯片的 AI 推理服务。
- 创新芯片制造商 Cerebras 推出了自己的 AI 推理服务。
- 该公司将使用其最新的 Wafer Scale Engine 芯片,其速度优于传统 GPU。
- Crebras 以每百万 tokens 仅需 10 美分的极具竞争力的价格提供该服务。
Cerebras Systems 周二宣布为开发者推出 AI 推理解决方案。据该公司声称,这是一种速度更快的推理解决方案,比英伟达的产品快 20 倍。
Cerebras 将提供对其更大芯片的访问权限以运行 AI 应用,据该公司称,这些芯片也比英伟达 GPU 更便宜。行业标准英伟达 GPU 通常通过云服务提供商访问,以运行 ChatGPT 等大型语言模型。对于许多小型公司来说,获得访问权限通常既困难又昂贵。
Cerebras 声称其新芯片能交付超越 GPU 的性能
AI 推理是操作已训练好的 AI 模型以获取输出(如聊天机器人的回答和解决不同任务)的过程。推理服务是当今 AI 应用的骨干,因为它们依赖这些服务进行日常运营以服务于用户。
Cerebras 表示,推理是 AI 行业中增长最快的领域,占云计算中所有 AI 相关工作负载的 40%。Cerebras 首席执行官 Andrew Feldman 表示,该公司巨大的芯片比 GPU 提供更高的性能。他说,GPU 无法达到这一水平。Feldman 在接受路透社采访时发表了上述言论。
他补充道,
“我们以最高的精度执行,并以最低的价格提供。” 来源: 路透社.
这位首席执行官表示,现有的 AI 推理服务并不能令所有客户满意。他在旧金山告诉另一组记者,公司“看到了对更快且具成本效益解决方案的各种兴趣”。
迄今为止,英伟达凭借其黄金标准的芯片和 Compute Unified Device Architecture (CUDA) 编程环境主导了 AI 计算市场。这通过提供 vast array 的工具,帮助英伟达将开发者锁定在其生态系统内。
Cerbras 芯片的内存是 Nvidia H100 GPU 的 7000 倍
Cerebras 表示,其高速推理服务是 AI 行业的转折点。该公司新推出的芯片大小如餐盘,被称为 Wafer Scale Engines。它们每秒可处理 1000 个 token,该公司称这堪比宽带互联网的引入。
据该公司称,新芯片为不同的 AI 模型提供不同数量的输出。对于 Llama 3.1 8B,新芯片每秒可处理多达 1800 个 token,而对于 Llama 3.1 70B,每秒可处理 450 个 token。
Cerebras 提供每百万 token 10 美分的推理服务,低于基于 GPU 的服务。行业普遍观点认为,替代方案通常以牺牲精度为代价换取性能,而据公司声称,Cerebras 的新芯片能够保持精度。
Cerebras 表示将以不同形式提供 AI 推理产品。公司计划通过其云服务和开发者密钥推出推理服务。该公司还将向数据中心客户以及希望运营自己系统的客户出售新芯片。
新的 Wafer Scale Engine 芯片拥有自己的集成冷却和供电模块,作为名为 CS-3 的 Cerebras 数据中心系统的一部分。根据不同 报道,Cerebras CS-3 系统是公司推理服务的骨干。
该系统的内存容量是 Nvidia H100 GPU 的 7000 倍。这也解决了内存带宽这一根本问题,许多芯片制造商正试图解决这一问题。
Cerbras 也在努力成为一家上市公司。为此,它本月已向美国证券交易委员会(SEC)提交了保密招股说明书。
如果您正在阅读这篇文章,说明您已经领先一步。请继续通过我们的通讯保持关注。
免责声明。 本文提供的信息不构成交易建议。 Cryptopolitan.com 对于基于本页信息进行的任何投资,我们不承担任何责任。我们强烈建议在进行任何投资决策之前,进行独立研究或咨询合格的专业人士。

Aamir Sheikh
Aamir 是一位科技记者,在加密货币和科技行业拥有近六年的经验。他毕业于 MAJ 大学,获得金融与市场营销 MBA 学位。目前他在 Cryptopolitan 工作,报道加密货币市场的最新发展和价格预测。
















