
关键要点
亚马逊网络服务有限公司(AWS),Cerebras Systems 今日宣布了一项合作,将在未来几个月内提供最快的AI推理可用的解决方案生成式人工智能应用程序和大型语言模型(LLM)工作负载。该解决方案将部署在Amazon Bedrock在 AWS 数据中心中,结合 AWS由Trainium驱动服务器,Cerebras CS-3 系统以及弹性 fabric 适配器(EFA)网络。今年晚些时候,AWS 还将提供领先的开源大语言模型(LLMs)和Amazon Nova使用 Cerebras 硬件。
"推理是人工智能为客户创造实际价值的关键环节,但对于实时代码辅助和交互式应用等高要求负载而言,速度仍然是一个关键瓶颈。" AWS 计算与机器学习服务副总裁 David Brown 表示。"我们通过 Cerebras 正在构建的解决方案正是为了解决这一问题:通过将推理工作负载拆分到 Trainium 和 CS-3 上,并利用亚马逊弹性 fabric 适配器(Elastic Fabric Adapter)将它们连接起来,每个系统都能发挥其最擅长的能力。最终实现的推理速度将比当前可用方案快一个数量级,性能也更高。"
"与 AWS 合作构建解耦式推理解决方案,将为全球客户带来最快的推理能力。" Cerebras Systems 创始人兼首席执行官 Andrew Feldman 表示。"世界各地的每家企业都将能够在其现有的 AWS 环境中受益于极速推理。"
工作原理:推理解耦
TheTrainium+ CS-3 解决方案实现了“推理解耦”(inference disaggregation),这是一种将 AI 推理分为两个阶段的技术:提示处理(即“预填充”,prefill)和输出生成(即“解码”,decode)。这两个阶段具有截然不同的计算特性。预填充本质上是并行的,计算密集,且需要中等程度的内存带宽;而解码则是固有的串行过程,计算量较轻,但对内存带宽的要求极高。在这些场景中,解码通常占用了大部分推理时间,因为每个输出 token 都必须按顺序逐个生成。
由于每个阶段面临不同的计算挑战,它们各自受益于不同的计算架构,以及两者之间低延迟、高带宽的 EFA 网络连接。通过战略性地解耦推理问题——由针对预填充优化的 Trainium 和针对解码优化的 Cerebras CS-3 分别承担——这两种不同的计算挑战可以得到专业化的优化。
该新解决方案基于 AWS Nitro 系统构建,这是 AWS 安全、高性能云基础设施的基础。它将确保 Cerebras CS-3 系统和由 Trainium 驱动的实例在安全性、隔离性和运营一致性方面,与客户对 AWS 的一贯期望保持一致。
用于预填充的 AWS Trainium 和用于解码的 Cerebras CS-3
Trainium 是亚马逊专为人工智能打造的芯片,旨在为广泛的生成式 AI 工作负载提供可扩展的性能和成本效益。全球两家领先的 AI 实验室——Anthropic 和 OpenAI——均已承诺采用 Trainium。Anthropic 已将 AWS 指定为其主要训练合作伙伴,并使用 Trainium 来训练和部署其模型;而 OpenAI 将通过 AWS 基础设施消耗 2 GW 的 Trainium 容量,以支持对状态化运行时环境(Stateful Runtime Environment)、前沿模型及其他高级工作负载的需求。自 Trainium3 近期发布以来,客户采纳率强劲,各行业组织均承诺投入大量容量。
Cerebras 的 CS-3 是全球最快的 AI 推理系统。其内存带宽比最快的 GPU 高出数千倍。随着推理模型如今占推理计算的大部分,并在“思考”解决问题时每次请求生成更多 token,加速这一工作流程部分的需求也随之增长。OpenAI、Cognition、Mistral 等公司使用 Cerebras 来加速其最苛刻的工作负载,尤其是在受推理速度制约开发者生产力的智能体编码场景中。
在解耦解决方案中,CS-3 将完全专注于解码加速,从而实现更快的输出 token 的高容量。由 Trainium 处理预填充(prefill),CS-3 处理解码操作,并通过高速 EFA 网络连接,每个处理器都能为其专注的工作负载部分提供最大的 token 容量。
关于 Amazon Web Services
Amazon Web Services (AWS) 以客户痴迷、创新速度、对运营卓越的承诺以及长期思维为指导原则。近二十年来,AWS 通过技术民主化,使各种规模和行业的组织都能使用云计算和生成式 AI,从而构建了历史上增长最快的企业技术业务之一。数百万客户信赖 AWS 来加速创新、转型业务并塑造未来。凭借最全面的 AI 能力和全球基础设施布局,AWS 赋能构建者将宏大构想变为现实。
关于 Cerebras Systems
Cerebras Systems 打造全球最快的 AI 基础设施。我们是一支由开创性计算机架构师、计算机科学家、AI 研究人员及各类工程师组成的团队。我们汇聚在一起,通过创新与发明让 AI 运行得极快,因为我们相信,当 AI 足够快速时,它将改变世界。我们的旗舰技术 Wafer Scale Engine 3 (WSE-3) 是全球最大且最快的 AI 处理器。56 倍于最大 GPU 尺寸的 WSE 在单位算力下仅消耗极少功率,同时提供的推理和训练速度比竞争对手快 20 倍以上。来自四大洲的领先企业、研究机构和政府选择 Cerebras 来运行其 AI 工作负载。Cerebras 解决方案支持本地部署和云端部署。
本新闻稿包含前瞻性陈述,包括关于我们产品预期收益及本文所述交易的陈述。这些陈述受可能导致实际结果出现重大差异的风险和不确定性影响。我们或任何其他人均不对前瞻性陈述的准确性和完整性承担责任。本新闻稿中包含的前瞻性陈述仅涉及截至本新闻稿发布之日的事件和信息。Cerebras 无义务因新信息、未来事件或其他原因而更新或修订任何前瞻性陈述,除非法律另有要求。

