关键要点
当亚马逊收购芯片设计公司 Annapurna Labs 时,人工智能热潮尚需数年才会到来。这一押注的逻辑很直接:如果为云工作负载专门设计芯片,而不是依赖通用硬件,就能以更低的成本实现更好的性能。
对 AI 基础设施的不同押注
十年后,这项押注已成为亚马逊历史上增长最快的业务之一。
亚马逊的芯片业务——涵盖用于 AI 训练和推理的 Trainium 以及用于通用云计算(且日益应用于智能体 AI)的 Graviton——均基于 Nitro System 构建,以保障安全性和网络能力。其年化收入近期已突破 250 亿美元,同比增长达三位数。
凭借在 AI(通过 Trainium)和 CPU(通过 Graviton)领域领先的价格性能芯片,我们在这场 AI 拐点中处于异常有利的地位。
Andy Jassy
亚马逊首席执行官
为什么亚马逊要自主研发芯片
过去,AI 芯片市场在降低成本方面一直缺乏紧迫感,市场领导者很少会自我颠覆。亚马逊选择了一条不同的道路。
亚马逊并非仅仅依赖现成的处理器,而是从头开始设计芯片以适配特定的工作负载。这种方法是垂直整合的:硬件和软件工程师从芯片设计到服务器部署全程协作,自系统层面逆向推导,打造专为实际客户运行工作负载量身定制的硅片。
AWS Trainium3 芯片
最终形成了三个各具特色且互补的芯片系列:
- Trainium:专为 AI 训练和推理而设计,即用于训练 AI 模型以及大规模运行这些模型的计算密集型任务。
- Graviton:负责通用云计算,包括网站、应用程序、数据库,以及日益增多的驱动现代软件的智能体(agentic)AI 工作负载。在我们排名前 1,000 的 EC2 客户数量以及收入承诺环比增长近三倍。Graviton5 作为最新一代产品,相比前代性能提升了高达 25%,且增长速度几乎是 Graviton4 的两倍。
- 硝基(Nitro):为 AWS 云基础设施背后的网络、存储和安全提供动力。
正如首席执行官安迪·贾西在公司 2026 年第二季度收益电话会议中所言:“我们芯片业务的收入年化规模现已超过 250 亿美元。凭借在 AI 领域(通过 Trainium)和 CPU 领域(通过 Graviton)领先的性价比芯片,我们在这一 AI 拐点时期处于尤为有利的地位。除了全球两大领先 AI 实验室 Anthropic 和 OpenAI 已做出多年、多吉瓦级的 Trainium 采购承诺外,越来越多的 AI 初创公司也在采用 Trainium。”
亚马逊芯片对 AI 客户意味着什么
对于使用 AI 进行开发的公司而言,芯片的经济性至关重要。训练前沿 AI 模型可能需要数十万块芯片连续运行数周甚至数月;大规模部署该模型——每天处理数百万次查询——则需要高效的推理基础设施。即使在性价比上的微小提升,在规模化应用时也能带来显著的成本节约。
这就是为什么全球领先的 AI 实验室和科技公司纷纷对亚马逊的芯片做出重大承诺:
- Anthropic:已承诺使用多达五吉瓦的当前和未来几代 Trainium 芯片来训练和运行其 Claude 模型,这些模型在超过一百万个 Trainium2 芯片上运行。Anthropic 还使用了数千万个 Graviton 核心,以在各种生成式 AI 工作负载中提供可扩展的性能和成本效益。
- OpenAI:已承诺到 2027 年开始,通过 AWS 基础设施消耗 2 吉瓦的 Trainium 算力以支持其前沿模型。
- Meta:已签署一项部署数千万个 Graviton 核心的协议,以支持其代理式 AI(agentic AI)工作背后的高 CPU 密集型负载。
- 优步:正在使用 Graviton 能在几分之一秒内将骑手与司机匹配,而 Trainium3 则用于训练使每次出行更智能的 AI 模型。
为满足客户需求而以前所未有的规模打造的 AI 芯片
Amazon Bedrock 是该公司为数十万客户提供的托管式 AI 服务,主要在 Trainium 上运行推理任务。越来越多的 AI 初创企业也在采用 Trainium,包括 Neura Robotics(为物理 AI 选择 Trainium)和 Odyssey(选择 Trainium 构建模拟物理的世界模型,其每美元获得的实用算力几乎是替代方案的两倍)。加入它们的还有 TwelveLabs、DeCart、Poolside、Karakuri、Matagenomi、NetoAI、Splash Music 等其他初创公司,以及 Uber、Pinterest 等大型企业。
在 Graviton 方面,目前已有超过 130,000 名客户使用基于 Graviton 的服务器。新增处理能力的半数以上来自 AWS 运行在 Graviton 芯片上。
AWS Graviton5 芯片
这种需求反映了 AI 基础设施建设方式的转变。随着 AI 系统从回答问题转向执行操作——包括实时推理、代码生成和多步骤任务编排——所需的计算能力对 AI 加速器和 CPU 都提出了极高的要求。而亚马逊在这两个领域均有所布局。
但单个芯片只是故事的一部分。亚马逊将它们连接成越来越强大的系统:
- Trn3 UltraServers:将多达 144 个 Trainium3 芯片集成到一个系统中,提供比 Trainium2 UltraServers 高 4.4 倍的计算性能。这使得客户能够在数周内完成模型训练,而非数月。
- 雷尼尔项目(Project Rainier):是全球最大的 AI 计算集群,专为大规模训练前沿模型而设计,目前正在运行 Anthropic 的 Claude 模型。
- 能效:Trainium3 每兆瓦输出的令牌数比 Trainium2 高出五倍以上,这种效率在大规模应用中对于成本和环境影响都至关重要。
深入 Project Rainier:全球最大的人工智能计算集群之一。
人工智能、硅基芯片与量子计算:亚马逊芯片业务的未来
亚马逊的芯片路线图持续加速。Trainium4 已在开发中,Graviton 正不断演进以适配代理式 AI 时代。而在彼得·德桑蒂斯(Peter DeSantis)的带领下,目前领导一个涵盖 AI 模型的新组织,定制硅芯片以及量子计算,该公司正在整合这些技术,使它们相互增强。
“我们能够在构建这些模型时获得优势的一种方法,是利用我们在芯片领域的深厚投入,提供兼具高性能和成本效益的解决方案,从而在模型开发中实现差异化。”亚马逊 AI 模型、芯片与量子计算高级副总裁 Peter DeSantis 表示。
这是一种基于简单前提的策略:掌控自身硅芯片的公司将主导人工智能的发展步伐。凭借覆盖训练、推理和通用计算的芯片组合,以及早已吸引客户多年后仍持续关注的路线图,亚马逊正在构建基础设施层,AI 的下一个时代将在其上运行。
了解更多关于 AWS 硅创新的信息。

