大数跨境

Trainium3 UltraServers 现已上市:助力客户以更低的成本更快训练和部署 AI 模型

Trainium3 UltraServers 现已上市:助力客户以更低的成本更快训练和部署 AI 模型 亚马逊
2025-12-02
2
导读:Amazon EC2 Trn3 UltraServers 使企业能够运行雄心勃勃的 AI 训练任务。

关键要点

  • Trainium3 UltraServers 为 AI 工作负载提供高性能,计算性能较 Trainium2 UltraServers 提升高达 4.4 倍,能效与内存带宽均接近 4 倍,助力以更低的运营成本加速 AI 开发。
  • Trn3 UltraServers 最多可扩展至 144 个 Trainium3 芯片,提供高达 362 FP8 PFLOPs 算力,延迟降低 4 倍,支持更大规模模型训练及大规模推理服务。
  • Anthropic、Karakuri、Metagenomi、NetoAI、Ricoh 和 Splash Music 等客户已将训练和推理成本降低高达 50%;Decart 实现实时生成式视频推理速度提升 4 倍且成本仅为 GPU 一半;Amazon Bedrock 已在 Trainium3 上承载生产级工作负载。
随着 AI 模型规模与复杂度不断提升,对计算和网络基础设施的要求日益严苛。客户亟需缩短训练时间并降低推理延迟。当前,仅靠扩大集群规模难以突破并行化限制以实现更快训练,单实例架构也无法满足实时推理需求。为此,我们宣布 Amazon EC2 Trn3 UltraServers 正式全面可用。该服务器采用基于 3nm 工艺的全新 Trainium3 芯片,帮助各类组织以更低成本、更快速度训练大模型并提供推理服务,普及高性能 AI 计算能力。

Trainium3 UltraServers:专为下一代 AI 工作负载打造

Trn3 UltraServers 集成多达 144 个 Trainium3 芯片,计算性能比 Trainium2 UltraServers 高出最高 4.4 倍。这将模型训练耗时从数月缩短至数周,同时支持更多并发推理请求,有效降低产品上市时间与运营成本。
在 OpenAI 开源模型 GPT-OSS 测试中,Trn3 UltraServers 每芯片吞吐量提升 3 倍,响应速度比 Trn2 UltraServers 快 4 倍。企业得以用更小基础设施规模应对峰值需求,在改善用户体验的同时降低单次推理成本。
Trainium3 通过先进设计创新、优化芯片间互连技术及增强型内存系统,消除了处理大型 AI 模型的瓶颈。除性能突破外,其能源效率较上一代提升 40%,在大规模部署中显著降低成本并减少数据中心环境影响。

面向规模化的先进网络基础设施

AWS 将 Trn3 UltraServer 打造为涵盖芯片架构到软件栈的垂直整合系统。核心网络基础设施专为消除分布式 AI 通信瓶颈设计:NeuronSwitch-v1 使 UltraServer 内部带宽翻倍,增强的 Neuron Fabric 网络将芯片间通信延迟降至略低于 10 微秒。
智能体系统(agentic systems)、混合专家模型(MoEs)及强化学习等未来 AI 工作负载需要处理器间海量数据无缝流动。该网络支持构建近乎即时响应的 AI 应用,解锁实时决策系统与无延迟对话式 AI 等新场景。
EC2 UltraClusters 3.0 可连接数千台 UltraServer,支持多达 100 万个 Trainium 芯片(上一代的 10 倍),为训练下一代基础模型提供强大基础设施。这使得在万亿 token 数据集上训练多模态模型或为数百万用户提供实时推理成为可能。

已在前沿规模下看到显著成果的客户

Anthropic、Karakuri、Metagenomi、NetoAI、Ricoh 和 Splash Music 等公司已利用 Trainium 将训练成本较其他方案降低高达 50%。Amazon Bedrock 已在 Trainium3 上运行生产级工作负载,验证了芯片的企业级成熟度。
专注于高效生成式 AI 视频和图像模型的 Decart 实验室,正利用 Trainium3 处理实时生成式视频等高要求负载,帧生成速度比 GPU 快 4 倍且成本减半,推动了个性化直播与大规模模拟等新互动内容类别的发展。此外,AWS 与 Anthropic 合作的 Project Rainier 已连接超 50 万个 Trainium2 芯片,构建了全球最大的 AI 计算集群。Trainium3 在此基础上进一步扩展 UltraCluster 架构,为下一代前沿模型提供更高性能。

展望下一代 Trainium

Trainium4 正在开发中,旨在全面提升性能指标:FP4 处理性能至少提升 6 倍,FP8 性能提升 3 倍,内存带宽提升 4 倍,以支持下一代前沿模型训练和推理。结合软硬件持续优化,实际收益将远超基线改进。作为行业标准精度格式,FP8 在现代 AI 工作负载中平衡了准确性与效率,3 倍 FP8 性能提升意味着训练速度或推理请求量至少提高三倍。
为实现更大扩展性,Trainium4 将支持 NVIDIA NVLink Fusion 高速芯片互连技术。该集成将使 Trainium4、Graviton 和弹性 fabric 适配器(EFA)在 MGX 机架中无缝协作,提供兼具 GPU 与 Trainium 服务器的成本效益型机架级 AI 基础设施,构建灵活高性能平台以满足严苛的训练和推理需求。
Amazon EC2 Trn3 UltraServers 现已正式推出,欢迎了解并开始使用。
其他资源:
  • AWS AI 博客
  • 文档
  • 了解客户如何使用 Trainium
  • 开始使用 Trainium
获取 AWS re:Invent 最新新闻,包括智能体和生成式 AI 相关内容、产品与服务公告等。
【声明】内容源于网络
0
0
亚马逊
亚马逊旨在借助亚马逊全球资源,帮助中国卖家抓住跨境电商新机遇,发展出口业务,拓展全球市场,打造国际品牌。
内容 3102
粉丝 0
亚马逊 亚马逊旨在借助亚马逊全球资源,帮助中国卖家抓住跨境电商新机遇,发展出口业务,拓展全球市场,打造国际品牌。
总阅读354.2k
粉丝0
内容3.1k