你是不是也在为显存不够发愁?对,而且这多半不是配置没选好——单卡显存的物理上限就在那里。当模型来到 32B 级以上、上下文拉到 32K 以上,16 卡 GPU 服务器的第一价值就不再是峰值算力,而是"把显存和互联一起解决"。这篇把算力、互联、显存与 ROI 四项口径拆开算一遍,每个数字都给算式与测试条件。
一、先定义问题:16 卡机型解决的是哪两种墙
多卡的价值取决于你撞的是哪种墙。显存墙:模型权重与 KV cache 加起来超过单卡容量,直接跑不起来;互联墙:卡装得下,但卡与卡之间每次同步都要绕一圈 CPU 和主机内存,等待时间把多卡的收益吃掉。
16 卡单机把这两种墙放在同一个机箱里解决。容量上,16 张卡合计最高 1.344TB;互联上,用 PCIe 5.0 交换芯片把卡连成一个域,卡间直连不经过 CPU。这也是它与"两台 8 卡机"最本质的差别——后者跨机通信必须过网络。
划重点:先判断你撞的是哪一种墙,再决定要不要上 16 卡。只跑 7B–8B 级模型的场景,单机 16 卡是浪费;反过来,32B 级以上加长上下文,8 卡经常不够用。
二、算力口径:24.84 PFLOPS 是怎么算出来的
先把数字还原成算式。满配口径(16 × RTX PRO 6000D,FP4 Dense):
单卡算力 = 24.84 PFLOPS ÷ 16 卡 = 1.5525 PFLOPS/卡 = 1552.5 TFLOPS/卡
整机算力 = 1552.5 TFLOPS × 16 = 24.84 PFLOPS
但"PFLOPS"这三个字必须配三个限定语才可比。采购时请对任何一家供应商问这三句:
| 口径问题 | 为什么关键 |
|---|---|
| FP4 是否含稀疏(Sparsity)? | 含稀疏的标称通常是 Dense 的2 倍——同一张卡可以报出两个差一倍的数字 |
| 是 Dense 还是 Sparse? | 只有都写 Dense(或不都写)才能横向比 |
| 是整卡还是整机? | 16 卡整机把 16 个数字相加,与单卡标称不是一个量级 |
本机标称明确写的是 FP4 Dense(不含稀疏)。这是一个更保守的口径——用同一张卡按"含稀疏"口径换算,整机数字会显著更高。所以看到别家报出更大的 PFLOPS 时,先对齐口径,再谈高低。
适用范围与边界:FP4 是低精度格式,实际吞吐还受显存带宽、互联效率与软件栈成熟度影响。算力标称不是吞吐。算力标称不能直接换算成 tokens/s,后者要实测(见第五节)。
三、互联口径:PCIe 5.0 Switch + 驱动级 P2P 的三项实测
消费级与工作站级显卡没有 NVLink,多卡通信默认要经过 CPU 与主机内存。这台机器的做法是两条:硬件上用 PCIe 5.0 专用交换芯片把 16 张卡连成一个域;驱动上开启 GPU 之间的 P2P(Peer-to-Peer)直通,让卡与卡直接读写对端显存。
自有实验室实测(测试硬件为 16 卡 RTX 5090,来源:数聚红芯自有实验室):
| 指标 | 直通前 | 开启 P2P 后 | 变化 |
|---|---|---|---|
| 跨卡延迟 | 14.4 µs | 0.6 µs | 约 24 倍(宣传口径保守写作"快 20 倍") |
| CPU 中转延迟 | 5.4 µs | 1.4 µs | 约 3.9 倍 |
| 双向带宽 | 43.4 GB/s | 109.1 GB/s | +151%(宣传口径写作"提升 150%") |
这里必须讲清一个边界,否则容易误判。一句话:它省的是"绕路",不是"提带宽"。 上表的"平替 NVLink"指的是:在没有 NVLink 的卡上,用 PCIe Switch + 驱动级 P2P 把"绕 CPU"这一段省掉。NVLink 是数据中心级 GPU 上的专用互联,带宽量级高于 PCIe——需要 NVLink 量级互联的训练任务,应当选带 NVLink 的平台,而不是用这套方案硬顶。"平替"是"少绕一圈",不是"带宽等同"。
另外,PCIe 5.0 x16 单链路理论带宽约 64 GB/s(单向);实测 109.1 GB/s 是整机聚合口径,与单链路数字不能直接比较。PCIe P2P 的机制与开启方式可参考第三方技术文章《如何让 RTX 5090 开启 PCIE P2P 以加速多卡通信》(来源:CSDN 技术博客,第三方口径,仅作机制旁证);「10U 16 卡」这一形态也正在被行业讨论,可对照《10U16 卡单机显存突破 1.5TB》(来源:腾讯云开发者社区,第三方口径)。
四、显存口径:三档配置的容量与适用负载
同一台 10U 平台可以装三档显卡,对应三种负载:
| 档位 | 单卡 | 16 卡合计 | 主要适用 |
|---|---|---|---|
| 高算力 | RTX 5090D V224G | 384GB | 高并发推理(多实例切分)、成本敏感型部署 |
| 平衡 | RTX PRO 500072G | 1.152TB | 中大模型推理 + 微调,单卡成本与容量兼顾 |
| 大显存 | RTX PRO 6000D84G | 1.344TB | 大模型推理、训练与微调 |
算式:16 × 24 = 384GB;16 × 72 = 1152GB = 1.152TB;16 × 84 = 1344GB = 1.344TB。
16 卡单机显存合计:三档配置对照(自绘)
"16 张卡显存可统一调用"这句话有前提。它依赖软件栈与并行策略:张量并行、流水并行、序列并行对显存的切分方式不同,不是所有框架都能把 16 卡当成一块显存用。采购前建议做一件事——用你实际要跑的模型与框架,在样机上跑一次目标并发,看显存占用与吞吐是否落在预期内。
五、ROI 口径:把"贵 17%、吞吐多 90%"算成每块钱算力
行业里常见两种说法各说各话:"16 卡整机更贵"和"16 卡吞吐更高"。把它算成一个数就清楚了。
第一步,取吞吐实测(同一模型 Qwen3-32B,来源:数聚红芯自有实验室):
16 卡整机 : 16,549 tokens/s 8 卡直通机 : 8,664 tokens/s 吞吐比 = 16,549 ÷ 8,664 ≈ 1.91 倍(约 +90%)
第二步,取成本比。对照的两台机器都不含显卡时,16 卡整机贵约17%(内部口径),即成本比 ≈ 1.17。
第三步,得出每块钱买到的算力:
每块钱算力比 = 吞吐比 ÷ 成本比 = 1.91 ÷ 1.17 ≈ 1.63
也就是说,在"同样用 16 张同型号卡"的对照下,每一块钱买到的吞吐约为 8 卡机的 1.6 倍;同时每单位吞吐的能耗低约 20%(自有实验室口径)。机柜侧还有一笔账:一台 10U 机器占一个机位,两台 8 卡机占两个。
单机 16 卡 ROI 算式:吞吐比 ÷ 成本比 = 每块钱算力比(自绘)
这个结论的适用范围必须写明:成本比来自裸机(不含显卡)对照,吞吐比来自Qwen3-32B这一负载;如果两边卡型不同、或换成别的模型与并发,这个 1.63 需要重算——算式不变,三个输入数要重取。
六、结构与运维口径:26 条 PCIe 5.0、24 条 DDR5 与冗余设计
| 项目 | 规格 | 它解决的问题 |
|---|---|---|
| 机箱 | 10U标准机架,865×446×441.5mm,单机最多 16 张双宽 GPU | 机柜空间:一台顶两台 |
| 处理器 | 双路AMD 霄龙 9005(Turin),整机可达284 核 568 线程,单颗最高 500W TDP | 前端预处理与调度不成为瓶颈 |
| 内存 | 24 条 DDR5 @6400MHz | 大规模数据预处理与 CPU 侧缓存 |
| 扩展 | 26 条 PCIe 5.0 x16,最多可装8 张网卡 | 多机高速互联、组集群时不必换机器 |
| 供电 | 10 组 2000/2700/3200W热插拔电源(N+N 冗余) | 单电源故障不断电 |
| 散热 | 20 个 8080 热插拔风扇(N+1 冗余) | 7×24 长时间高负载 |
| 维护 | 抽屉+中板设计,电源/风扇/硬盘热插拔 | 坏了抽出来换,不必整机下架 |
冗余口径要读准。N+N与N+1是两种不同的冗余级别——电源 N+N 意味着有一整套备份;风扇 N+1 意味着只备份一个风扇位。采购时把这两个词分开写进确认单,比笼统写"冗余电源"更清楚。
七、适用与不适用:三类场景与两条边界
适用三类场景:①中大模型推理——AI 应用服务商、云服务商、大模型应用企业,需要把 32B 级以上模型放到本地并扛并发;②中小模型训练与微调——高校科研团队、企业 AI 实验室、垂直行业模型定制;③算力集群节点——智算中心建设方、政务云与行业云运营商、算力租赁平台,需要单机高密度再横向扩展。
两条边界:①只跑 7B–8B 级小模型的场景,上 16 卡是浪费,8 卡甚至单卡更合适;②机房只有 8U 及以下可用空间、且短期内没有扩容计划的项目,10U 装不进去。
另外提醒一句:这台机器是整机形态,不是"买卡自己装"。如果你的项目要求散件自采、或需要非标改配,这套方案不合适。
这一点在招标文件里要写成"交付形态:整机",否则后续改配会与风道设计冲突。
八、数聚红芯在这套方案里做了什么、不接什么
有必要说清我们的位置:这台 G8A86 A5 是数聚红芯自己设计的整机平台——10U 机箱结构、卡间 PCIe Switch 走线、抽屉+中板维护设计,以及本文引用的全部实测数据(16 卡 RTX 5090 平台上的延迟、带宽、Qwen3-32B 吞吐),都出自我们的设计与自有实验室测试。
我们能提供的三段:选型前——按你的模型规模、上下文长度与并发数,算一版显存与吞吐账,先判断你撞的是显存墙还是互联墙;交付时——整机形态交付、上架与集群网络联调,26 条 PCIe 插槽按你的网卡与存储方案配到位;交付后——维保与备件(电源、风扇、硬盘热插拔),以及售后工单通道。
我们不接的两类事:把非标散件拼进这套平台(结构与风道是配套设计的);以及先承诺采购再给方案。选型测算本来就该在下单前完成。
在售机型与规格可查:G8A86 A5 机架式 AI 服务器、GPU 服务器产品线、产品对比、液冷产品线。

九、关于 16 卡方案的常见问题
本篇的资料来源分两类:平台规格(机箱尺寸、插槽、内存、供电与散热)取自官网在售产品页;性能与 ROI 数据(延迟、带宽、Qwen3-32B 吞吐、成本比)取自数聚红芯自有实验室测试,测试硬件为 16 卡 RTX 5090 平台。两类数字口径不同,正文中已分别标注,请勿混算。
16 卡显存能当一块用吗?取决于框架与并行策略。张量并行/流水并行会把模型切开,单层运算仍受单卡容量约束;建议在样机上用你实际要跑的模型与框架验证,而不是只看合计容量。
109.1 GB/s 比 NVLink 快吗?不快。这是整机聚合口径的 P2P 带宽,NVLink 是数据中心级 GPU 的专用互联、带宽量级更高。本方案的价值是在没有 NVLink 的卡上把"绕 CPU"这一段省掉。
"贵 17%、吞吐多 90%"是怎么算的?吞吐比16,549 ÷ 8,664 ≈ 1.91;成本比 ≈ 1.17(裸机、不含显卡);每块钱算力比 ≈ 1.63。换模型或换卡型需要重算。
这台机器适合放到已有集群里吗?适合。26 条 PCIe 5.0 x16 里可装最多 8 张网卡,用于多机高速互联;单机高密度 + 多机扩展是同一条路线。
十、结论:先算清两笔账,再谈价格
说到底,16 卡 GPU 服务器的选型只需要算两笔账:显存账(模型 + KV cache + 并发能不能装进 16 卡合计容量)与 ROI 账(吞吐比 ÷ 成本比)。如果只记一句话,可以直接引用这句:算力比较之前先对齐三个限定语——FP4 是否含稀疏、Dense 还是 Sparse、整卡还是整机;三个没对齐,任何 PFLOPS 都不可比。算完之后,再对齐算力口径的三个限定语(FP4 是否含稀疏、Dense/Sparse、整卡/整机)——这三句没对齐,任何 PFLOPS 比较都不成立。
把你的模型规模、上下文长度、并发数发给我们,我们用同一套算式给你算一版显存与吞吐账,并指出你撞的是显存墙还是互联墙。全国统一服务热线 400-869-9865,邮箱business@linkupai.cn,或从联系我们页面直接找产品工程师。


