大数跨境

中国信通院赵伟博等:人工智能时代高性能网络发展现状与趋势

中国信通院赵伟博等:人工智能时代高性能网络发展现状与趋势 中国信通院CAICT
2026-09-10
3

引言

高性能网络是算力互联网架构中算网设施层的关键技术,承载算力服务器间的资源互联与数据高速传输。随着人工智能(AI)大模型参数规模的爆发式增长,传统网络架构已难以满足高带宽、低时延及无损传输的严苛需求。AI 训练与推理场景的分布式特性,驱动横向扩展(Scale-out)网络成为主流,并反向推动网络技术创新。

在数字经济加速演进背景下,智能 IP 广域网(AI-WAN)成为网络智能化升级的核心引擎。当前网络架构正处于以 AI 为核心驱动力的新变革阶段:AI 不仅作为关键应用牵引网络演进,更深度重构互联网基础架构与技术体系。构建高性能 Scale-out 网络已成为支撑 AI 技术持续发展的关键基础设施,其演进路径与发展趋势亟待深入探究。

AI 时代高性能网络面临的核心挑战,在于协调算力扩展需求与网络性能约束间的动态平衡。一方面,AI 模型规模和算力需求增速远超硬件供给;另一方面,分布式训练系统的整体效能因网络通信开销制约,常低于线性扩展预期。因此,深入探究高性能 Scale-out 网络的演进路径至关重要。

1 高性能网络发展现状

1.1 Scale-out 与 Scale-up 网络对比

Scale-out 与纵向扩展(Scale-up)代表两种核心架构策略。Scale-out 通过聚合多节点并行协作扩展容量,适用于大规模分布式训练;Scale-up 则通过升级单节点硬件配置增强性能,适配高密度单节点任务。

从性能需求看,Scale-out 需支持百 G 级带宽、微纳秒时延,适用于数据并行、流水线并行等场景;Scale-up 需支持 T 级带宽、百纳秒时延,适用于张量并行、专家并行等高通信计算比场景。从规模适配性看,Scale-out 适合万卡级以上集群,Scale-up 受限于单节点物理限制,通常适用于小规模互联。

在通信模式层面,Scale-out 以跨节点“东西向流量”为主导,聚焦梯度更新等数据同步;Scale-up 集中于单节点“机内流量”,强调加速器间高速互联。随着 AI 大模型向多模态、长序列及混合专家模型(MoE)演进,通信模式从单一的全归约(All-Reduce)扩展至全收集、全交换等多样化操作,对 Scale-out 网络的灵活性与适应性提出更高要求。

1.2 RDMA 能力增强

远程直接内存访问(RDMA)技术通过绕过 CPU 内核协议栈和内存复制,实现超低时延、超高吞吐量传输,已成为 Scale-out 网络核心技术。RDMA 经历了从无限带宽(InfiniBand,IB)、iWARP 到基于融合以太网的 RDMA(RoCE)的演进,形成三大主流技术路径(见表 1);拥塞控制算法也主要分为三大类型(见表 2)。

表 1 主流技术路径

表 2 主流拥塞控制算法

当前,RDMA 技术演进重心转向算法创新与硬件协同。RoCE v2 凭借低成本、高兼容性成为云计算资源池网络主流方案;InfiniBand 在超算集群中仍具不可替代性。新一代 RDMA 网卡正集成高效丢包恢复与端到端流控技术,降低对优先级流控制(PFC)的依赖,为更大规模网络部署提供可行性。

1.3 端侧能力提升

端侧能力提升体现于网卡、协议栈及存储与 GPU 互联三个维度。网卡通过数据处理单元(DPU)卸载网络协议处理等任务,显著降低 CPU 开销。主流智能网卡架构分类见表 3。

表 3 主流智能网卡架构

在协议栈优化方面,用户态网络处理技术(如 DPDK)通过旁路机制减少中断开销,结合大页内存与 CPU 亲和性提升缓存命中率。

在存储与 GPU 互联方面,分布式持久性内存文件系统融合 RDMA 与新型存储介质构建高速体系;多播传输文件系统则通过内核态 RDMA 框架实现低延迟多播,规避传统一对一传输冗余。

端侧能力提升的核心价值在于实现“零拷贝”与"CPU/GPU 卸载”。实测表明,RDMA 处理性能优于 TCP,对 AI 大模型训练尤为关键。

1.4 端网协同优化

端网协同优化是 Scale-out 网络性能突破的核心路径,主要沿网络架构创新与控制算法融合两大方向推进。

在网络架构创新方面,新型扁平化架构通过重构拓扑提供低成本扩容方案。例如,多平面 Fat-Tree 拓扑利用交换机端口拆分技术,可在两层架构下实现 12.8 万卡集群组网。

在控制算法融合方面,AI 驱动的软件定义网络(SDN)调度成为新范式。Network AI 架构通过深度强化学习与带内遥测技术,结合全局视图动态生成最优管控策略,实现网络管控自动化。

2 高性能网络面临的技术挑战

2.1 高带宽需求与网络成本矛盾

随着大模型参数规模突破万亿级,训练集群从千卡级跃升至万卡级,Scale-out 网络面临带宽需求与成本的显著矛盾。传统 Fat-Tree 拓扑成本随层级线性增长,十万卡级集群若采用传统三层架构,成本将超出可接受范围。硅光模块成为降低扩容成本的关键方向。

技术路线权衡是矛盾核心。Meta 采用“框式交换机 + 电互联”提升稳定性;阿里则以“盒式交换机 + 双平面光互联”实现无收敛设计。此外,单轨组网因适配稀疏模型流量特征,预计将成为未来主流方案。

2.2 低延迟稳定性与拥塞控制

Scale-out 网络需实现μs 级低延迟以满足 AI 需求,但现有技术仍面临稳定性挑战。以 RoCEv2 为例,缓存水线配置调优的高复杂度直接制约异构组网实施。

All-Reduce 作为梯度同步核心算子,其延迟随节点数线性增长。依据 DeAR 模型,最大加速比受限于通信与计算时间占比。当通信计算比较高时,通信耗时主导整体性能,成为瓶颈。

低延迟稳定性挑战源于物理链路延迟与网络排队延迟的叠加。跨域传输时,经过更多交换设备导致排队延迟累积,总时延进一步放大。

拥塞控制算法方面,传统算法(如 DCQCN、TIMELY)与新型算法(如 HPCC)各有优劣。DCQCN 实现简单但参数调整困难;TIMELY 无需交换机支持但反应较慢;HPCC 控制精确却面临部署复杂挑战。

2.3 智算互联复杂性与拓扑适配

一是拓扑扩展与负载均衡面临挑战。Dragonfly 拓扑受路由策略限制;Torus 拓扑虽降低成本,但通信带宽利用率受维度限制,且随规模扩大通信路径增长,导致稀疏模型性能衰减显著。

二是多厂商设备兼容性差。CXL、UCIe 等新兴标准与现有 PCIe/RDMA 的兼容性仍需完善。英伟达 NVLink 主要用于 Scale-up 场景,而 AMD UALink 和 Intel CXL 在跨平台 Scale-out 部署中仍面临协议适配问题。

三是通信模式与网络架构的动态匹配难。AI 模型演进使通信模式多样化,传统 Fat-Tree 静态设计难以适应稀疏通信需求。新型拓扑(如 Slim Fly、BST 等)通过动态路由和带宽分配策略,可提升对稀疏模型的适配性。

3 未来发展趋势

面对智算互联复杂性,未来高性能网络将沿“新协议、新硬件、新范式”逻辑主线突破,核心趋势体现为开放化、光电融合化、自治化的协同演进。

新型互联协议从专有封闭走向开放标准。CXL 支持 CPU/GPU/DPU 共享内存池,推动亚微秒级低延迟通信;UALink 定位高带宽、低延迟加速器直连。二者共同支撑异构算力协同。

光电融合通过硅光集成与共封装光学(CPO)技术突破瓶颈。硅光集成实现光模块成本与功耗双降;CPO 缩短电通道,支撑超高密度交换容量,推动光互联从“模块级”向“芯片级”渗透。

AI 驱动网络自治从“人工配置”向“意图驱动”转型。利用数字孪生预演、Transformer 模型预测流量及开源生态统一协同,实现网络从“被动响应”到“主动优化”的质变。

“协议 - 硬件 - 算法”协同创新的本质是:协议开放化解决生态割裂,硬件光电化突破物理极限,范式自治化释放运维效率,三者共同支撑 AI 时代超大规模集群需求。

4 结束语

Scale-out 网络作为 AI 时代高性能计算核心基础设施,已通过 RDMA 增强、端侧提升与端网协同实现关键突破。然而,其发展仍面临高带宽需求与成本张力、低延迟稳定性局限、拓扑扩展复杂性等多重矛盾,亟需从“规模扩张”向“效率与可持续性并重”转型。

未来,下一代 Scale-out 网络将以跨层协同创新重构技术范式:协议开放化打破生态割裂,推动异构计算互联向系统级一致性演进;硬件光电化重塑能效边界;范式自治化借 AI 驱动实现动态自适应。关键在于摒弃单一维度优化,通过协议、硬件、算法深度融合,支撑超大规模集群的高性能、低能耗与高可靠需求,推动算力互联从“可用”迈向“好用”。

作者简介

赵伟博

中国信息通信研究院云计算与数字化研究所工程师,主要从事云计算、网络、算力服务相关领域研究工作。

桑柳

中国信息通信研究院云计算与数字化研究所工程师,主要从事高性能网络、算力服务相关领域研究工作。

陈锐豪

中国信息通信研究院云计算与数字化研究所工程师,主要从事云网络、算网融合相关领域研究工作。

苏越

中国信息通信研究院云计算与数字化研究所云计算部副主任,高级工程师,长期从事云计算、算力等方面的研究工作。

马飞

通信作者。中国信息通信研究院云计算与数字化研究所云计算部主任,博士,高级工程师,长期从事算力互联网、云计算相关领域研究工作。


论文引用格式:

赵伟博,桑柳,陈锐豪,等。人工智能时代高性能网络发展现状与趋势 [J]. 信息通信技术与政策,2026, 52(2): 30-35.




本文刊于《信息通信技术与政策》2026 年 第 02 期



主办:中国信息通信研究院


《信息通信技术与政策》是工业和信息化部主管、中国信息通信研究院主办的专业学术期刊。本刊定位于"信息通信技术前沿的风向标,信息社会政策探究的思想库",聚焦信息通信领域技术趋势、公共政策、国家/产业/企业战略,发布前沿研究成果、焦点问题分析、热点政策解读等,推动 6G、新型工业化、人工智能、脑机接口、先进算力等技术产业的创新与发展,引导国家技术战略选择与产业政策制定,搭建产、学、研、用的高端学术交流平台。


期刊荣誉与收录情况

AMI(2022 版)A 刊扩展期刊

RCCSE 中国核心学术期刊

入选中国科协信息通信领域高质量科技期刊分级目录





《信息通信技术与政策》投稿指南!


为进一步提高期刊信息化建设水平,为广大学者提供更优质的服务,我刊官方网站已正式投入运行,欢迎投稿!






校 审 | 谨言、珊珊

编 辑 | 凌霄


"

推荐阅读

中国信通院屈蕾蕾等:互联网应用欺骗误导行为现状与治理策略研究
专家谈

【声明】内容源于网络
0
0
中国信通院CAICT
1234
内容 6154
粉丝 0
中国信通院CAICT 1234
总阅读70.9k
粉丝0
内容6.2k