先给结论:多卡不是"卡越多越好",是先想清楚你跑训练还是推理、要多少显存和互联,再倒推上几张卡。我看到太多人一上来就奔着"8 卡",买回去一半卡闲着、或者训练卡在 PCIe 通信上出工不出力。
上个月帮一家设计院看方案,预算够,点名要 8 卡。我问了一句"你跑什么",他说跑 7B 蒸馏版推理、还要做点设计渲染。我当场就给他按回去:推理为主、单模型不到 32B,2 张 48G 卡都还有富余,8 卡纯属浪费钱和电。你品,你细品——多卡的账,得从需求倒着算,不是从"卡多显得气派"正着算。
下面把"多卡怎么配"这套账讲清楚。
一、先分清楚:你是训练还是推理?
这两者对多卡的需求天差地别,这是配置的第一分水岭:
| 维度 | 训练 / 微调 | 推理 |
|---|---|---|
| 显存大头 | 权重 + 梯度 + 优化器 + 激活(翻好几倍) | 权重 + KV Cache |
| 多卡核心价值 | 并行算力,缩短训练时间 | 更大模型 / 更高并发 |
| 互联依赖 | 重(每步都要同步梯度) | 相对轻(张量并行的模型间要通信) |
| 典型卡数 | 4~8 卡起步 | 单卡~2 卡就能跑大部分蒸馏版 |
一句话:训练吃互联,推理吃显存。训练场景 NVLink/高带宽互联是刚需;纯推理场景,很多时候单机几张卡就够,为互联花的钱可能白花。
二、显存 / 卡数怎么倒推
接上一篇的速算:单卡显存 ≈ 权重 + KV Cache + 余量。
- FP16:
显存(GB) ≈ 参数量(B) × 2 × 1.4 - INT4 量化:
显存(GB) ≈ 参数量(B) × 0.6~0.7
卡数 = 总显存需求 ÷ 单卡显存,再往上取整数,并留并发/上下文余量。
举例:
- 跑 32B 蒸馏推理(INT4 ~20GB):一张 24G/32G 卡即可,2 卡是为了并发或冗余。
- 跑 70B 蒸馏推理(INT4 ~43GB 或 FP16 ~140GB):FP16 得 2×80G 或 H200 单卡,INT4 一张 80G 或 2×48G 就能带。
- 跑满血 671B(DeepSeek MoE 推理):单机 8 卡靠张量并行+足够互联才现实,或直接集群。
所以,"8 卡"是因为你的模型和并发"必须 8 卡",不是因为"大家都上 8 卡"。
三、多卡的四种互联,别只盯卡数
这是多卡配置最容易被忽悠的地方。8 张卡摆在那,通信不过关就是 8 个孤岛:
- NVLink / NVSwitch:GPU 直连、带宽高(可达 GB/s 级)、延迟低,训练和大模型张量并行首选。多卡训练尽量走这条路。
- PCIe 5.0:够推理和大多数混合负载用,但多卡全量训练时容易成为瓶颈。浪潮这类 4U 平台一般同时给 PCIe 5.0 通道。
- InfiniBand:跨机/集群级互联,单机 8 卡内部一般用不到,多机并行才需要。
判断口诀:单机多卡跑大模型训练 → 要 NVLink;单机推理/常规混合负载 → PCIe 5.0 就够;多机组建集群 → 再谈 InfiniBand。
四、浪潮 NF5468M7,作为 4U 多卡平台的落地示例
先把这台服务器的定位说清楚:它是 4U 机架式、双路 CPU、可插 8 张双宽 GPU 的算力平台,是"把多卡装进一台机器"的典型形态。它不是某一档"固定配置",而是"平台 + 显卡 + 内存 + 存储 + 电源"的组合,可按下述维度配:
| 配置维度 | 常见可选(经验参考,以验机为准) |
|---|---|
| CPU | 双路 Intel 至强 4 代/5 代可扩展(为 GPU 供数据吞吐) |
| 显卡(决定算力档次) | 8×RTX 4090 24G(192G 总显存)/ 8×RTX PRO 6000 96G(768G 总显存)/ H800·A100(80G)等 |
| 内存 | DDR5,最高可达 TB 级(大模型加载吃紧) |
| 互联 | PCIe 5.0 + NVLink(视所选 GPU 是否支持 NVLink) |
| 散热/供电 | 智能风冷或风液冷,N+N 冗余电源(高负载不降频的关键) |
| 存储 | 多块 NVMe SSD(系统/缓存)+ 大容量 HDD(数据集) |
怎么对号入座(给三种典型):
- 预算友好·推理/轻训练:8×RTX 4090(24G),192G 总显存。适合跑 32B 蒸馏推理、多路并发、轻量微调。注意:消费级卡不支持 NVLink,跨卡通信走 PCIe,所以重型训练别指望它。
- 单机能装超大模型·推理为主:8×RTX PRO 6000(96G),768G 总显存、带 NVLink,可把满血版大模型推理装进一台机器,省去跨机通信。适合"要跑上百 GB 显存模型"的场景。
- 企业级训练·要求互联:H800/A100(80G)+ NVLink,面向要稳定 7×24、要并行的训练负载。预算和供货是主要门槛。
补充一句预算观:多卡服务器初期贵,但长期省——尤其数据敏感、要长期稳定跑的场景,本地多卡比持续租云(月租数千起步)更划算。这条是否成立,取决于你的"负载时长 + 数据合规 + 并发",自己按账套一遍再定。
五、别光看计算:配套往往才是"翻车"的地方
多卡服务器最容易被忽略、也最容易翻车的三处:
- 供电与机房:8 张高功耗 GPU 满载功率很高,要确认机柜电源、UPS、制冷跟得上;别在普通办公室硬塞。
- 散热:高密度多卡必须风道/液冷到位,否则降频白买。NF5468M7 这类平台自带冗余散热设计,但机房环境温度仍是前提。
- 网络与数据:推理集群要考虑多台间组网(谈 InfiniBand 的场景);存储建议"数据底座"与"算力机"分层(例如数据量大的话,用浪潮 NF5266M6 这类高密度存储机型当底座)。
六、落地前,把这张多卡配置清单过一遍
- 跑训练还是推理?——决定互联要不要 NVLink、卡要不要那么多。
- 模型尺寸 + 精度 + 并发 + 上下文?——用显存速算倒推总显存需求。
- 单卡显存够不够装、要不要多卡拼?——得到"必须几张卡"。
- 有没有信创/数据不出网约束?——有则整条路线换成国产算力(见系列第 2 篇)。
- 下单前实际算力/显存验证跑过没有?——训练要过预热,推理要压并发测峰值显存。
- 机房供电/散热/网络/存储配套了吗?——补上再签字。
把这 6 条答完,多卡配置很难买错。商红科技作为浪潮联想核心伙伴,提供 4U 多卡平台的整机选型与配置实施,你把"训练/推理 + 模型尺寸 + 并发 + 是否信创"报过去,选型按这张清单对号入座即可。
END


