[中国,上海,2026年9月9日] 在PyTorch Conference China 2026大会上,Linux基金会云与基础设施执行董事、OpenInfra Foundation执行董事兼CNCF执行董事Jonathan Bryce演示了基于HyperParallel分布式并行组件的训练加速Live Demo,展示了HyperParallel在昇腾Atlas 800 A3风冷超节点上的卓越训练加速能力。随后华为AI框架首席技术专家苏腾介绍了HyperParallel-专为超节点打造的分布式并行组件,通过超节点亲和Module和FSDP零拷贝通信等技术实现高性能训练,未来也将贡献HyperParallel创新技术到PyTorch生态社区,加速AI生态创新迭代。
从原生支持到生态共建:昇腾与PyTorch合作迈入新阶段
首先回顾大会首日KN提到昇腾与PyTorch的生态合作已迈入新里程碑,询问昇腾新成立的Ascend for PyTorch开源社区进展,昇腾AI框架生态负责人王神迪介绍,Ascend for PyTorch社区(基于TorchNPU的中国社区)于今年5月正式成立,目前已汇聚超过1,000名贡献者,外部贡献占比超过50%,是中国发展最快的AI社区之一,社区正持续推动中国AI开发者深度参与PyTorch上游贡献。
HyperParallel:昇腾超节点亲和,加速新模型结构和新训推范式创新
随着大模型向十万亿参数、全模态、Agent化方向演进,训推共存、Agentic RL等新训练范式持续涌现,为超节点时代的分布式训练带来全新挑战。HyperParallel深度适配昇腾超节点的内存统一编址、超大带宽、超低时延等核心特性,通过硬件感知的编排机制,将超节点视为单一逻辑计算机进行全局调度,能够显著降低并行编程与系统调优开销,同时大幅提升训练效率。
HyperParallel兼容主流模型生态,无缝对接HuggingFace、LlamaFactory等开源生态库,提供大模型分布式训练全栈能力,并集成混合精度、通信优化、显存管理和DCP,实现从单卡到超大规模分布式训练的平滑扩展。
Live Demo演示:Qwen3-30B-A3B训练吞吐量提升超200%
Jonathan Bryce现场演示了Live Demo,在昇腾Atlas 800 A3风冷超节点上使用HyperParallel+PyTorch训练Qwen3-30B-A3B模型。在相同配置下,HyperParallel-FSDP2+Muon相比PyTorch-FSDP2+Muon,在保持loss收敛一致性(即模型训练效果完全一致)的前提下,训练吞吐提升幅度超过200%。
这一性能提升主要源于HyperParallel的两大核心优化:
高性能昇腾亲和module:在保持入参、出参一致的前提下,重写优化/替换包括attention、rmsnorm、muon等模块,如muon优化器通过HSDP&DP去冗余计算,以分组调度匹配超节点层次结构,达成主流模型生态开箱即优的效果。
FSDP2零拷贝通信:支持逐参数通信,避免了分组通信带来的数据拷贝(copy in/out)开销,实现了计算与通信的高效重叠,充分发挥了超节点的高带宽优势。
HyperParallel持续深耕技术创新,回馈PyTorch开源生态
HyperParallel会持续围绕多模态、长序列、高稀疏MoE模型等领域做深度优化,进一步支持torch compile图模式,支持好自动策略搜索、强化学习、世界模型等特性。秉持开放协作的理念,HyperParallel将持续把经过大规模生产验证的创新技术贡献给PyTorch等开源社区,与全球开发者共同推动分布式训练技术的演进。
欢迎全球开发者共同参与HyperParallel关键技术共建!
GitCode:
https://gitcode.com/mindspore/hyper-parallel
GitHub:
https://github.com/mindspore-ai/hyper-parallel


