一、中国智算市场爆发式增长,行业增速超 40%
智算市场规模(营收口径)2020 年国内智算市场仅 776 亿元,预测 2028 年将达到 34174 亿元,复合增长率 46.3%,AI 商业化落地持续拉动市场扩容。
2020-2028中国智算市场规模
智能算力规模(算力 EFLOPS 口径)2020 年国内智能算力 75 EFLOPS,2027 年预测达 1117.4 EFLOPS,CAGR33.9%,大模型训练、推理需求是核心驱动力。
2020-2027中国智能算力规模
二、算力基础概念:分类、精度、单位一次性讲清
1. 三大算力分类
- 基础算力
CPU 主导,通用业务、日常 IT 计算;以 FP32 单精度衡量 - 智能算力
GPU / 昇腾 / 昆仑等 AI 芯片,大模型训练推理,行业默认 FP16 半精度 - 超算算力
HPC 集群,科研、航空、气象模拟,标准 FP64 双精度
2. 浮点精度区别(FP16/FP32/FP64)
-
FP64(双精度):超高精度,仅超算模拟场景使用,算力成本最高 -
FP32(单精度):通用计算、传统模型训练 -
FP16/BF16/TF32(半精度):主流大模型训练、推理,平衡算力与能耗 -
INT8 低精度:推理场景专用,极致降低算力开销
不同精度任务分层图
3. 训练算力 vs 推理算力核心差异
三、主流 AI 芯片路线对比:GPU/FPGA/ASIC/ 国产芯片
1. 四大芯片架构优劣
- GPU
通用性最强,并行计算优秀;短板推理能效一般,代表 H100/A800 - FPGA
半定制、灵活迭代;量产单价高,适合细分行业推理 - ASIC
全定制、功耗最低、量大成本极低;前期研发投入高,周期 1 年以上,国产昇腾、昆仑芯均为此路线 - 类脑芯片
超低功耗,技术尚未成熟
2. 国内外主流 AI 芯片算力对比(FP16 稠密算力)
英伟达 H100 SXM 单卡 990TFLOPS(约 1P)、A800 312TFLOPS;国产昇腾 910B 376TFLOPS、昆仑芯 P800 375TFLOPS、天数天垓 150 190TFLOPS,国产芯片已具备规模化替代能力。
四、AI 服务器两大核心路线:PCIe 机型 vs NVLink(SXM)机型
1. 核心区别:GPU 互联带宽决定大模型训练能力
-
PCIe 机型:GPU 仅通过 PCIe 总线互通,H100 PCIe5.0 双向带宽仅 128GB/s,适合中小模型推理、微调 -
NVLink SXM 机型:专用高速互联链路,H100 NVLink 双向 900GB/s,是 PCIe 的 7 倍,千亿级大模型训练刚需
NVLink互联示意图
NVLink迭代带宽演进
2. NVLink 核心产品体系梳理
- HGX 模组
8 张 SXM GPU+NVSwitch 集成,逻辑上合并为单一大 GPU - DGX 整机
英伟达官方完整服务器,内置 HGX 模组 - DGX POD
整机柜集群,配套 IB 高速网络、分布式存储 - NVL72 机柜
全新一代一体化算力柜,72 块 B200 GPU 全互联,单柜超大规模训练集群
NVL72整机柜实拍
3. GPU 服务器与普通 x86 服务器 10 大差异
整机功耗更高、支持多块高功率 GPU、专用 NVLink 互联、液冷普及、单机价格数十万至百万级,主要承载 AI 训练、渲染、HPC 计算业务。
五、智算中心高速网络:IB InfiniBand 成大模型标配
千卡 / 万卡智算集群必须依靠超低延迟高速网络,主流方案分三类:
- InfiniBand(IB)
NDR/HDR 主流,原生 RDMA,延迟 2-5us,千亿大模型训练首选 - RoCE 以太网
基于以太网实现 RDMA,性价比均衡,中小型智算中心使用 - 标准以太网
通用业务承载,延迟偏高,不适合超大规模训练
IB 速率迭代:EDR (100G)→HDR (200G)→NDR (400G),最新 ConnectX-7 网卡、MQM9700 系列 400G 交换机支撑万卡集群组网。
算力产业进入高速扩张周期,做智算中心规划、大模型落地、算力采购时,需区分训练 / 推理场景、匹配浮点精度标准、优先选择 NVLink 高速互联服务器,同时配套 IB 高速网络,国产昇腾、昆仑芯等芯片可实现信创算力替代。

