- Project Rainier 现已投入使用,拥有全球规模最大的 AI 计算集群之一,配备了近 50 万颗 Trainium2 芯片。
- AWS 在首次宣布该项目不到一年的时间内就部署了这一庞大的 AI 基础设施项目,合作伙伴 Anthropic 已开始在其上运行工作负载。
- Anthropic 正在积极使用 Project Rainier 来构建和部署其行业领先的 AI 模型 Claude,目前该模型已部署在超过 100 万颗 Trainium2 芯片上。
Project Rainier 是全球最大的 AI 计算集群之一,自首次宣布以来不到一年时间便已全面投入运营。这一开创性项目标志着 AWS 在推进其 AI基础设施方面达到了前所未有的规模。
AWS 与AI 安全与研究领域的领导者 Anthropic合作开展了 Project Rainier 项目,该项目配备了近 50 万颗Trainium2 芯片,提供的算力是 Anthropic 用于训练其先前 AI 模型的算力的五倍以上。
Anthropic 正在积极使用 Project Rainier 来构建和部署其行业领先的 AI 模型——Claude。预计到今年年底,Claude 将部署在超过 100 万颗 Trainium2 芯片上,用于包括训练和推理在内的工作负载。
这些 AI 算力正被用于构建和部署 Claude 的未来版本。用于训练这一前沿模型的算力越多,该模型就会变得越智能、越准确。
一座算力的山峰
Rainier项目以雷尼尔山命名,这座海拔14,410英尺(4,392米)的层状火山在天气晴朗时从西雅图即可远眺。该项目本身也如其同名地标一般宏伟壮观。
该项目在美国多个数据中心铺开,其规模之巨是AWS此前从未尝试过的。
“Rainier项目是AWS迄今为止最具雄心的举措之一。”AWS杰出工程师、Trainium首席架构师Ron Diamant表示,“这是一个庞大且独一无二的基建项目,将引领下一代人工智能模型的发展。”
芯片,芯片,还是芯片
为实现这一大胆愿景,Rainier项目被设计为一个庞大的“Trainium2 UltraServers EC2超大型集群”。其中,“EC2”指的是Amazon Elastic Compute Cloud(弹性计算云),这是AWS的一项服务,允许客户在云端租用虚拟计算机,而非自行购买和维护物理服务器。
更引人注目的是Trainium2,这是一款专为AWS AI芯片而定制的芯片,专门用于训练人工智能系统。与笔记本电脑或手机中的通用芯片不同,Trainium2专为处理训练AI模型所需的海量数据而优化,能够以极快的速度教会AI模型完成各种日益复杂的任务。
借助Rainier项目,AWS已构建出比AWS历史上任何其他AI计算平台大70%的Trainium2基础设施。
为了更好地理解Trainium2的强大算力:单颗芯片每秒可完成数万亿次计算。如果这仍难以直观想象,不妨这样想:一个人需要超过31,700年才能数到一万亿。而人类需要耗费数千年才能完成的任务,在Trainium2上只需眨眼间即可完成。
从传统到超大型
令人印象深刻,但Rainier项目并非仅使用一颗或几颗芯片。这正是UltraServer和UltraCluster大显身手的地方。
在传统数据中心中,服务器通常独立运行。当它们需要共享信息时,数据必须通过外部网络交换机传输。这会引入延迟,而在如此大规模的部署中,延迟问题尤为不理想。
Rainier项目内部:全球最大的AI计算集群之一。
AWS对此问题的解决方案是UltraServer。这是一种新型计算解决方案,一台UltraServer将四台物理Trainium2服务器整合在一起,每台服务器配备16颗Trainium2芯片。它们通过称为“NeuronLinks”的高速专用连接进行通信。NeuronLinks以其独特的蓝色线缆为标识,如同专属的快速通道,使数据在系统内移动得更快,并显著加速全部64颗芯片上的复杂计算。
当你将数万台这样的UltraServer连接起来,并将它们指向同一个问题时,就形成了Rainier项目——一个超大型的“UltraCluster”。
不容许失败
组件之间的通信发生在两个关键层级:NeuronLinks 在 UltraServers 内部提供高带宽连接,而弹性 fabric 适配器(EFA)网络技术(通过其黄色电缆标识)则在数据中心内部及跨数据中心之间连接 UltraServers。这种双层方法在最需要的地方最大化速度,同时保持跨多个数据中心建筑扩展的灵活性。
到目前为止,一切顺利——但运营和维护如此庞大的计算集群并非没有挑战。为了确保所有巨大的容量可供客户使用,可靠性至关重要。这正是该公司在硬件和软件开发方面的方法真正凸显的地方。与大多数其他云提供商不同,AWS 自行构建其硬件,从而能够控制技术栈的每个方面,从芯片的最微小组件,到在其上运行的软件,再到整个数据中心的设计。
掌控技术栈
这种垂直整合使 AWS 在加速机器学习和降低 AI 可访问性的成本障碍方面具有显著优势。通过对整个技术栈(从芯片设计到软件实现再到服务器架构)的全面可见性,AWS 可以在系统中最合适的点进行优化。
有时解决方案在于重新设计供电系统,有时在于重写协调整个操作的软件,而很多时候则是同时采取所有这些措施。通过全面监督每个组件和系统层级,AWS 能够快速排查故障并推动创新。
规模化可持续性
随着运营 AWS 数据中心的团队快速创新,他们也在专注于提高能源效率——无论是从机架布局、电力分配还是冷却技术。就数据中心使用无碳能源而言:2023 年和 2024 年,亚马逊运营(包括其数据中心)消耗的所有电力均由 100% 可再生能源资源匹配。
该公司正在数十亿美元投资于核能和电池储能,并为全球大规模可再生能源项目融资以支持其运营。事实上,在过去五年中,亚马逊一直是全球最大的企业可再生能源采购方. 该公司仍朝着2040年实现净零碳排放的目标迈进。随着Project Rainier的加入以及公司全球范围内的持续增长,这一目标保持不变。
去年,AWS宣布将推出新的数据中心组件这些组件融合了电力、冷却和硬件方面的最新进展,不仅适用于AWS正在建设的数据中心,也将应用于现有设施。预计新数据中心组件可将机械能耗降低高达46%,并将混凝土中隐含的碳排放减少35%。
为支持Project Rainier及后续项目而新建的站点将包含多种提升能源效率和可持续性的升级措施。
其中一些站点将重点关注水资源管理。AWS对其设施进行工程设计,以尽可能少用水,甚至在可能的情况下完全不用水。实现这一目标的一种方式是在一年中的大部分时间里,在许多设施中取消冷却水的消耗,转而依赖外部空气。例如,位于印第安纳州圣约瑟夫县(Project Rainier的一个站点)的数据中心将最大限度地利用外部空气进行冷却。从10月到次年3月,这些数据中心在冷却过程中完全不用水;而在4月至9月的平均日子里,每天仅使用几小时的冷却水。
得益于此类工程创新,AWS在水资源效率方面处于行业领先地位。根据劳伦斯伯克利国家实验室(LBNL)最近发布的关于数据中心行业用水效率(WUE)的报告,衡量数据中心内部用水效率的行业标准指标是每千瓦时耗水0.375升。AWS的WUE为每千瓦时0.15升,优于行业平均水平两倍以上。与2021年相比,这也提升了40%。
AI的未来
Project Rainier不仅推动了技术边界——它代表了人工智能可能性的根本性转变。其影响远不止于使Claude成为一个更加复杂的模型。
Project Rainier现已成为部署强大计算能力的模板,这种能力将使AI能够应对长期困扰人类解决的挑战,从而在从医学到气候科学等各个领域实现突破。
正如其同名山峰作为太平洋西北地区的地标性象征,Project Rainier标志着计算历史上的一个分水岭时刻——一个可能通过每一块芯片逐步改变技术格局的时刻。
更多关于AWS的创新
- 深入了解Annapurna Labs,AWS在此设计定制芯片,并探索AWS芯片的复杂世界。
- 了解亚马逊如何通过硬件和液冷效率减少碳排放,以及优化工作负载。
- 了解 AWS 如何已实现超过 50% 的目标到2030年实现‘水资源正向’意味着它将向社区和环境返还的水量将超过其在数据中心运营中所消耗的水量。

