客户租用GPU集群的核心诉求,在于其稳定完成的训练步数与产出的Token量。
ClusterMAX 3.0评测涵盖全球323家GPU云服务商,经实际评审77家并访谈200多名终端用户后,仅19家进入奖牌档,15家获“参与奖”。数据显示,同型号GPU的短时算力差异微小,但模型装载时间可从10秒延至2分钟以上,节点重启恢复时间也从约2分钟拉长至近19分钟。硬件配置仅决定平台基础能力,而加载、通信、存储及恢复效率才是决定客户每日工作产出的关键。
77家服务商参评,仅19家跻身奖牌档
本次评级聚焦于托管集群服务。服务商需交付包含硬件、调度器、存储、监控及技术支持在内的完整解决方案,确保客户可直接进行训练或推理。单纯出租裸金属、机房电力或仅提供API调用的模式未纳入此比较范畴。
最终榜单中,CoreWeave与Nebius荣获铂金档,Google Cloud与Oracle位列金牌档,Azure、Lambda等处于银牌档。在参评的77家服务商中,仅有19家获得铜牌及以上评级。该评级体系综合考察调度、网络、存储、监控和故障处理能力,旨在验证整套集群的持续稳定性。
短跑分无法反映GPU云真实效能
完整测试环境包含32张GPU、800G RoCE或XDR InfiniBand网络、10TB以上高性能文件存储及10TB以上对象存储。Slurm与Kubernetes各运行5天,流程涵盖硬件、固件、容器、调度器、安全配置及监控系统的审计,随后依次进行性能与可靠性检查。
计算测试采用取自Kimi、DeepSeek等模型形状的分组矩阵乘法(GEMM)。短时测试难以拉开服务商差距,但若散热或供电无法承受持续负载,GPU将降频,导致峰值每秒浮点运算量(FLOPs)无法维持。
模型从共享存储装入显存的时间差异显著:部分平台仅需10至40秒,而其他平台超过2分钟。PyTorch加载时间在多数平台为1至2秒,但存在小文件读写问题的文件系统会将其拖慢至10至20秒。尽管GPU性能未变,等待时间却在持续消耗租期成本。
跨服务器任务中,GPU需频繁交换梯度和模型分片。测试分别测量all-reduce(汇总多卡数据再发回)、all-to-all(卡间互相交换)和all-gather(收集各卡分片)三类动作。消息大小覆盖8B至16GB,并单独关闭NVLink以检查服务器间网络性能。
存储测试结合峰值与持续负载场景。通过机器人数据流水线模拟视频和传感器数据写入,利用fio工具逐步增加客户端,追踪吞吐、IOPS及尾部时延。结果显示,部分服务商在持续负载下带宽较初始测试下降近40%。
真实训练同时占用计算、通信与存储资源
单项测试虽能定位瓶颈,但真实训练任务会同时调用GPU、HBM、NVLink、服务器网络和存储。以GPT-OSS混合专家模型为例,频繁的集合通信若遭遇网络配置错误或任务位置不当,将直接导致单卡Token产出下降。
可靠性测试要求GPU在连续8小时内执行大规模矩阵乘法,并让所有节点互相交换数据,期间记录温度、功耗、频率、运算量、连通性及内核错误。这种高负载并发测试能暴露单独烧机无法发现的连接、散热和供电隐患。
故障注入测试揭示修复速度差异
测试通过重启全部节点、注入GPU或互联错误,甚至重置GPU上游PCIe桥来触发真实的XID 79故障。随后记录平台发现故障、标记节点为DRAIN并停止接收新任务、以及恢复执行所需的时间。数据显示,不同平台节点从重启到重新进入可调度状态的时间跨度极大,从约2分钟至近19分钟不等。
单纯的绿色看板可能仅是过期快照。平台需将百余种GPU错误码映射为差异化动作:轻微故障重启应用,严重故障则需重置GPU或下线节点。一律重启会中断正常任务,而继续调度存在严重故障的GPU则会导致新作业反复崩溃。
硬件架构变迁也影响维修策略。HGX集群可热备替换带8张GPU的节点;而NVL72因无法将8张GPU直接接入现有高速互联域,单个计算托盘故障将导致4张GPU失效,平台只能选择机柜降级运行或整柜更换。备件位置、现场技术人员及审批流程均直接影响恢复时间。
可用率指标应纳入验收与合同条款
合同中需明确定义节点、机柜、集群及站点的停机计算方式。单节点退出调度与整套集群停摆对训练任务的损失截然不同,不能仅以月度可用率一概而论。
交付验收应包含实际运行的计算、网络、存储及软件测试,并明确持续时间、通过门槛及复测机制。合同还需规定故障超阈值后的服务费抵扣、修复期限及终止条件,从而将测试中发现的装载延迟、带宽下降和恢复时间问题纳入采购与续租决策依据。
结语:等待时间即隐性租金成本
同样配置32张GPU,优质平台可实现模型数十秒内装入显存、通信链路持续高效工作、故障节点几分钟内回归队列;而低效平台则让GPU耗费大量时间等待存储响应、网络传输及人工处理。鉴于租金按卡时累计,有效产出取决于压缩各类等待时间的能力。GPU云的交付能力,最终体现于每次加载、通信和恢复的效率之上。

