将GPU分散部署至不同园区,虽能拓展机房与电力资源的选择范围,但也对跨园区网络的稳定性与低延迟提出了严苛要求。在2026年OCP Canada Tech Day上,Ciena提出的“Scale Across”方案旨在将训练集群的横向扩展延伸至跨区域场景。该方案强调,跨园区链路需具备充足容量,沿线站点需容纳更多光传输设备,并实现链路的快速部署与维护。
距离时延与网络拥塞需分类治理
在多GPU协同训练过程中,集合通信涉及大量数据汇总与交换,同步环节需等待所有相关数据到位。若跨园区通信受阻,将导致整体训练停滞。这种等待主要源于两类因素:
- 距离时延:信号在园区间传输所需的物理传播时间;
- 网络拥塞:多组GPU并发发送数据时,若流量超出链路承载能力,将引发排队、拥塞控制甚至丢包重传。
Ciena报告指出,“尽量降低超售比”是缓解拥塞的关键,即避免大量通信需求拥挤在狭窄出口。增加光传输容量可缓解拥塞,但无法消除物理距离带来的时延。因此,除扩容外,还需从发送端速率调整及训练软件的拓扑感知能力入手,区分园区内与跨园区通信路径,优化调度策略。
选址与网络设计需根据距离权衡:150km以内的近距离方案侧重高容量、低超售及减少中继设备,以追求极致训练速度;跨区域方案虽在空间与电力获取上更具优势,但通信设计复杂度显著增加,需在效率与资源之间寻求平衡。
突破单模块限制,挖掘光纤整体容量
在AI互连案例中,Ciena展示了基于数百对光纤的配置,每对光纤利用C、L双波段承载64路800G信号。按此口径计算,每对光纤标称容量可达51.2Tb/s。这一规模表明,单纯关注800G光模块已不足以应对需求,整条线路的系统级容量成为关键指标。
进一步扩容可通过提升单路速率、增加波长数量或光纤对数实现,但这均依赖配套的线路系统进行传输、放大和保护。最终训练任务的有效吞吐量,还取决于通信协议效率及实际负载情况。
提升设备密度,缓解沿线站点压力
光信号长距离传输需沿途放大,典型中继站间隔约为80-100km。随着光纤对数(即“Rail”数量)激增至数百对,沿线站点的空间容纳能力与电力供应成为建设瓶颈。传统配置中,每机架仅支持4条Rail,每个机房容纳16条。
针对20Pb/s容量场景,Ciena对比了传统设计与Hyper-rail方案:传统设计需22个设备机房,而Hyper-rail方案通过整合设备,将所需机房缩减至1个。其核心在于将每机架支持的Rail数量从4条提升至128条,实现32倍的密度提升。
需注意,机房数量的减少并非合并地理中继点,光信号仍需沿途放大。高密度设备主要缓解了站点空间压力。此外,该方案宣称功耗降低75%,但未披露完整计算边界,应视为特定方案下的参考数据。
从逐波开通转向整纤部署
面对数百对光纤的规模,传统波分系统按波长逐路开通的模式效率低下。以800G配置为例,一对光纤两端需安装128个可插拔模块,海量模块的安装、配置与维护工作量巨大。
Ciena提出全频谱转发设备架构,将部署单元从单个波长升级为整根光纤。在该架构中,交换设备通过灰光模块连接外置转发设备,由后者集中处理线路侧波分传输。这种分工使得复杂的光传输配置得以集中处理并标准化复制,降低了现场对波分专业操作的依赖。同时,外置设备摆脱了可插拔模块的功耗限制,为提升传输性能预留了空间。
综上所述,跨园区光网络的优化涵盖提升单纤容量、提高沿线设备密度以及革新部署方式三个维度。然而,这些技术改进的实际价值,仍需在统一的模型、GPU配置及训练目标下,通过对比任务完成时间、GPU利用率及网络全生命周期成本来最终验证。

