点击蓝字关注雨生
标题:AWS“黑科技”曝光:GPU性能狂飙,云上AI训练成本暴降?!
副标题:Nvidia Blackwell GPU加持,AWS新实例价格大PK,出海企业如何选购最划算?
---
雨生云计算快讯
【重磅】亚马逊云服务(AWS)发布了基于Nvidia“Grace”CG100 CPU和“Blackwell”B200 GPU的首批UltraServer预配置超级计算机,代号U-P6e实例!**
这些机器采用了GB200 NVL72共享GPU内存配置,提供全机架和半机架配置。同时,AWS还在re:Invent 2024大会上发布的P6-B200实例也已于5月15日正式上线。
技术亮点:
* **NVLink互联:** P6和P6e实例都利用了GPU上的NVLink 5端口和NVLink Switch 4 GPU内存共享交换机,将GPU连接成大型共享内存计算复合体,类似于CPU服务器上已存在超过25年的NUMA集群。
* **GB200 NVL72设计:** 基于该设计的P6e实例,其GPU内存域跨越72个GPU插槽,每个Blackwell芯片有两个GPU小芯片,因此内存域实际上是单个机架中的144个设备。
* **液冷加持:** 这些机器将Grace CPU与每两个Blackwell B200 GPU配对,并采用液冷散热,使B200 GPU能够超频11%,从而为AI工作负载提供更高的原始计算性能。
* **P6实例:** 使用更标准的HGX-B200服务器节点,不进行超频,GPU内存域跨越8个插槽。P6实例使用英特尔至强6处理器作为其主机计算引擎,每8个Blackwell B200 GPU对应两个CPU,因此计算密度是GB200 NVL72系统的一半,仍然可以进行风冷散热。
**价格与性能分析:**
随着这两款Blackwell系统在AWS云上可用并提供定价信息,现在是对Blackwell实例与之前几代“Hopper”H100和H200 GPU,甚至更早基于“Ampere”A100和“Volta”V100 GPU的实例进行性价比分析的绝佳时机。
**EC2容量块:**
AWS以EC2容量块的形式销售这些实例和UltraServer机架规模配置,允许用户预留和购买预配置的UltraCluster,其大小从一个实例或UltraServer到最多64个实例或机架不等,期限最长为六个月,最多可提前八周预订。
性价比对比:
* 该文章详细对比了各种GPU实例和AWS Trainium实例在不同地区的定价以及FP16、FP8、INT8和FP4精度下的峰值理论性能。
* **结论:**
* Blackwell B200 GPU在性价比方面具有显著优势,尤其是在FP4精度下,可以大幅降低AI训练成本。
* AWS Trainium2在FP8精度下也具有很高的性价比。
* 较老的GPU实例在性价比方面已经落后,除非万不得已,不建议使用。
**【雨生点评】**
各位出海的朋友们,AWS的这次升级,对AI应用开发者来说无疑是重大利好!
* **技术红利:** Blackwell GPU带来的性能提升,意味着出海企业可以更快地训练更大规模的AI模型,加速产品创新。
* **成本优势:** 通过选择合适的实例类型和精度,可以有效降低AI训练成本,提高投资回报率。
* **战略选择:** 是选择AWS的Blackwell GPU实例,还是选择AWS自研的Trainium芯片,需要根据具体的应用场景和成本预算进行权衡。
**建议:**
* 出海企业需要密切关注AWS等云服务商的最新技术动态和定价策略,及时调整云资源配置,以获得最佳的性价比。
* 同时,也要加强对AI算法和模型的研究,充分利用FP4等低精度计算技术,进一步降低AI训练成本。
总而言之,AWS的这次升级,为出海企业提供了更强大、更经济的AI基础设施。如何抓住机遇,提升自身竞争力,是每个出海企业都需要认真思考的问题!
---
以下是该文章的中文翻译:
**The Next Platform**
搜索:
搜索 …
AWS “Blackwell” GPU 系统与之前的 GPU 和 Trainium
2025 年 7 月 10 日 Timothy Prickett Morgan
本周,Amazon Web Services 宣布推出其首款基于 Nvidia “Grace” CG100 CPU 和 “Blackwell” B200 GPU 的 UltraServer 预配置超级计算机,采用所谓的 GB200 NVL72 共享 GPU 内存配置。 这些机器被称为 U-P6e 实例,实际上有全机架和半机架配置,它们是对去年 12 月在 re:Invent 2024 大会上发布的,并于 5 月 15 日正式推出的现有 P6-B200 实例的补充。
对于 P6 和 P6e 实例,GPU 上的 NVLink 5 端口和 NVLink Switch 4 GPU 内存共享交换机用于将 GPU 连接成大型共享内存计算复合体,类似于 CPU 服务器上已经存在超过 25 年的 NUMA 集群。其他非 NUMA 共享内存架构比非均匀内存访问技术更早,例如对称多处理 (SMP),但没有一种能像 CPU 上的 NUMA 那样扩展得那么远,早在单核处理器时代,它就将共享内存集群中的 CPU 推到了 128 和 256 个。
对于基于 Nvidia NVL72 设计的 P6e 实例(我们在此处详细介绍),GPU 内存域跨越 72 个 GPU 插槽,Blackwell 芯片每个插槽有两个 GPU 芯片,因此内存域实际上是单个机架中的 144 个设备。AWS 正在销售具有 72 个或 36 个 Blackwell B200 插槽作为内存域的 UltraServer,据推测,这是以虚拟方式而不是物理方式完成的,因此可以在运行时配置实例大小。这些机器将 Grace CPU 与每两个 Blackwell B200 GPU 配对,并且整个系统都采用液冷,这也是 B200 GPU 超频 11% 并在 AI 工作负载中提供更多原始计算性能的原因之一。
P6 实例使用更标准的 HGX-B200 服务器节点,这些节点未超频,并创建跨越 8 个插槽的 GPU 内存域。P6 实例使用 Intel Xeon 6 处理器作为其主机计算引擎,每 8 个 Blackwell B200 GPU 对应两个 CPU,因此生成的计算复合体的密度是 GB200 NVL72 系统的一半,因此仍然可以进行风冷散热。
随着这两种 Blackwell 系统现在在 AWS 云上可用,并且定价信息也已公布,现在是对 Blackwell 实例与之前几代 “Hopper” H100 和 H200 GPU,甚至更早基于仍然可以在 AWS 云上租用的 “Ampere” A100 和 “Volta” V100 GPU 的实例进行性价比分析的绝佳时机。
我们检查的实例和 UltraServer 机架规模配置以 AWS 所谓的 EC2 容量块出售,顾名思义,这是一种预留和购买预配置的 UltraCluster 的方式,其大小从一个实例或 UltraServer 到最多 64 个实例或机架不等,期限最长为六个月,最多可提前八周预订您需要的容量。它是以较大块作为单个单元出售的预留实例的一种奇特版本。
为了好玩,我们采用了 EC2 容量块配置,还找到了具有按需定价的设置,以查看这些配置的成本与基于 Nvidia Volta GPU 的 P2 实例和基于 Ampere GPU 的 P3 实例相比如何。
因此,事不宜迟,这是 EC2 容量块的所有电子表格之母,其中显示了全球各地可用的区域的定价,包括 Nvidia GPU 实例以及 AWS Trainium1 和 Trainium2 实例:
这里有很多东西需要吸收。为了了解性价比如何,我们添加了具有 FP16、FP8 或 INT8 以及 FP4 精度的峰值理论性能。为了进行此比较,我们忽略了 FP64 和 FP32 精度,我们充分意识到有时 AI 模型会使用更高的精度计算,并且 HPC 模拟肯定会使用更高的精度计算。这些性能评级适用于密集数学,而不是稀疏矩阵,后者可以使设备的有效数值吞吐量翻倍。
我们认为 90 天的租期代表了训练相当大的模型所需的时间,但并非疯狂。这种规模的实例成本构成了一个很好的红利,除数将性能切分为万亿次浮点运算。
从这个庞大的表格中跳出了很多东西,但我们看到的第一个也是我们在粗体中突出显示的,是 AWS 对基于 Hopper H100 和 H200 GPU 的 GPU 实例收取 25% 的溢价,这些实例由其美国西部北加利福尼亚地区提供。在硅谷获得电力和数据中心空间非常困难,这就是为什么您看到这么多新产品安装在美国西部地区的俄勒冈州区域。美国东部地区以弗吉尼亚州阿什本为中心,它仍然首先获得了很多好东西,包括基于 GB200 NVL72 设计的 UltraServer P6e 机架规模系统。正如您所看到的,俄亥俄州的美国东部地区也获得了其份额的新产品,包括 Trainium1 和 Trainium2 集群。
我们将 FP16 性能视为 AI 加速器的一种基准,然后将 FP8 和 FP4 精度视为模型的重要进一步加速器,这些模型可以使用较低分辨率的数据进行训练,而不会牺牲模型的准确性。
如果您查看机架规模 GB200 NVL72 系统与 HGX-B200 系统的 FP16 性能,后者无法扩展到那么远,那么机架规模机器(需要液冷并且安装起来有点困难)仅以 AWS 租赁它的方式提高了 17% 的性能单位。这实际上根本不是溢价,并且与您根据系统的密度以及 GB200 NVL72 的密度引起的功率和冷却问题所期望的一致。
您将看到的另一件事是,H100 和 H200 设备具有相同的峰值理论性能,但 AWS 安装的 H100 是较早的型号,只有 80 GB 的 HBM3 容量,而 H200 有 141 GB 的 HBM3 容量。AWS 对此内存和随之而来的更高带宽收取 10% 的溢价。具有 80 GB HBM3 的 H100 具有 3.35 TB/秒的带宽,而具有 141 GB HBM3E 的 H200 提供 4.8 TB/秒的带宽。对于许多工作负载,这种额外的内存容量和带宽几乎可以使 AI 训练的实际性能翻倍。您可能期望 AWS 对 H200 实例收取比实际更高的溢价。
[AWS 的 GB200 NVL72 系统的液冷。]
仍然可以使用 Ampere A100 GPU 加速器获取 EC2 容量块,并且有趣的是,在每个 GPU 的基础上,H200 比 A100 贵 3.07 倍,但它提供 3.17 倍的每个 GPU 的 FP16 性能。如果您进行计算,通过容量块租用具有 40 GB HBM2 内存的 A100 90 天的成本为每万亿次浮点运算 10.21 美元,而 H100 的成本为每万亿次浮点运算 9.88 美元。只有在您无法获得 H100 或 H200 或 B200 时才会这样做。具有 80 GB HBM2 内存的 A100 的成本为每万亿次浮点运算 12.78 美元。(所有这些价格都适用于北加利福尼亚以外的地区。)
在 FP16 精度下,具有 72 个 Blackwell B200 GPU 的 P6e 实例中的全尺寸 NVL72 机器以及具有 36 个 Blackwell B200 的半机架的租用成本为每万亿次浮点运算 9.14 美元,为期 90 天,这三个月的成本分别为 165 万美元和 822,856 美元。具有较小内存域的 P6-B200 实例在 90 天内在 FP16 精度下的成本为每万亿次浮点运算 7.81 美元,考虑到这些实例是风冷的并且具有较小的内存域,这就可以理解了。令人惊讶的是,液冷 GB200 NVL72 机器的成本并不高。
如果您查看 FP8 性能,则每个万亿次浮点运算的所有成本都会减半,并且对于 Blackwell,以 FP4 格式进行计算的能力会再次将万亿次浮点运算的成本减半。最终结果是,如果您更改模型以利用 FP4 性能,您可以租用四分之一的机器以四分之一的成本完成相同的工作,或者您可以花费相同的钱来训练大四倍的模型。
现在查看表格底部的 Trainium。就原始 FP16 吞吐量而言,需要两倍数量的 Trainium1 AI 加速器(由 AWS 设计)才能击败 Nvidia A100 约 22%。对于 Trainium2,FP16 的性能提高了 3.5 倍,FP8 的性能提高了 6.8 倍,而 HBM 容量提高了 3 倍,但 FP16 分辨率下每万亿次浮点运算的成本仅提高了 7.4%。添加 FP8 将 FP8 精度下的万亿次浮点运算的价格降至仅 3.72 美元,低于 AWS 以 P6 实例租用的 HGX-B200 节点的每万亿次浮点运算 3.91 美元,甚至低于 AWS 对 GB200 NVL72 实例收取的每万亿次浮点运算 4.57 美元。Trainium2 不支持 FP4,这意味着在原始成本方面,Nvidia 对于那些可以以 FP4 分辨率运行且不会损失准确性的 AI 应用程序具有优势。
现在,如果您查看 AWS 上的按需定价,Trainium1 芯片仍然可用,并且它们比按需租用的 Blackwell B200 实例贵得多。看看:
[点击放大]
在此表中立即显而易见的是,基于 K40、V100 和 A100 GPU 的旧加速器实例具有非常低的成本,因此资本支出非常低,这看起来很有吸引力,但如果您查看 FP16 性能的每万亿次浮点运算的成本,这些在经济意义上非常糟糕,并且与在 EC2 容量块计划下销售的新产品之间存在更大的差距。如果您将这些以 FP16 模式运行的旧 GPU 与以 FP4 模式运行的 Blackwell 进行比较,那么除了可能在绝对紧急情况下,考虑使用这种旧产品简直是愚蠢的。
显然,如果您需要按需租用实例,请租用 Blackwell 并以 FP4 模式运行。如果您这样做,FP16 性能的成本降低了 9%,并且随着精度降低两个档位,您可以将性能提高 4 倍,并将性价比提高 4.4 倍。
摩尔定律仅以降低精度的形式真正存在,而不是以缩小晶体管的形式存在。FP2 怎么样?正如有些人所说,FP1 没有任何意义。
. . .
对了《多云价值管理与增长》新课程出炉,雨生和SRE刘老师联袂授课,欢迎学友们关注!
报名链接 公众号:SRE书友会
《多云价值管理与增长》培训班火热报名:从理论到实战,一站式提升!

