大数跨境

全球第一超算跑满血DeepSeek!一张GPU没用,打造超智融合「Token工厂」

全球第一超算跑满血DeepSeek!一张GPU没用,打造超智融合「Token工厂」 新智元
2026-08-07
1

新智元报道

在“灵晟”国产超算登顶最新一期全球超级计算机 TOP500 榜单后,清程极智与“灵晟”联合完成纯 CPU MoE 模型分布式推理方案:

16 节点即可流畅运行 DeepSeek-V3/R1-671B 模型,在 batch_size=2048 时,输出吞吐量与 80 张主流 GPU 集群相当。

这不仅是一次 HPC 与 AI 融合的技术突破,更提供了观察国产算力从基础设施转化为 Token 生产能力的新样本:当算力、模型与推理软件实现系统级协同优化,超算将不再局限于传统科学计算,而是进化为持续生产大模型 Token 的“工厂”。

架构革新:“灵晟”筑就 AI 大模型推理新基石

为何要在超算上跑 AI?产业需求揭示了两大核心动因:一是方法融合,即科学计算物理模型与数据驱动的 AI 深度结合,催生颠覆性科研成果;二是效能提升,利用超算平台错峰运行 AI 任务,最大化算力资源利用率。

审视“灵晟”,其最大亮点在于架构层面的原生超智融合:

  • 算力侧:不同于单纯堆砌专用加速卡的传统路径,“灵晟”在自研 LX2 CPU 中引入矩阵加速单元并支持多精度,实现片上 HPC 算力与 AI 算力深度融合。尤为关键的是,CPU 集成了片上内存(高带宽内存),提供 TB 级带宽,相较传统 CPU 实现十倍跃升,为大模型推理中的大批量并发处理提供了充足带宽保障。
  • 网络侧:自研“灵启”网络支持μs 级低时延传输,具备可扩展至 200 万端口、10 万节点的超大规模组网能力。这种极低时延、极高扩展性的互联特性,有效消除了分布式推理中的通信瓶颈。

硬件创新仅是第一步。鉴于“灵晟”LX2 CPU 与 GPU/NPU 架构存在本质差异,要将大模型从“专卡”平滑迁移至“通卡”,必须攻克软件层面的重重难关。

软硬协同:释放超智融合澎湃算力

HPC 与 AI 虽属不同计算范式,但在核心优化思路上殊途同归——均依赖算子优化、计算与访存重叠、流水线并行及多级并行等手段,以充分释放硬件性能。结合“灵晟”平台硬件特性及自研软件,清程极智从多个技术维度对大模型推理进行了深度加速。

1. 面向“灵晟”LX2 CPU 的算子开发与优化

针对“灵晟”自研软硬件,清程极智完成了算子重构:基于 LX2 CPU 的矩阵运算指令集,结合 OpenMP 与自研编译器实现计算算子;基于自研通信库构建通信算子。

借助具备计算图语义扩展、共享内存通信加速、多线程调度优化及硬件特性抽象等核心能力的自研统一并行加速库,团队实施精细化的指令序列控制,应用计算掩藏访存、异步流水线调度等优化策略。

针对无依赖关系的多个算子,团队切分线程池,分布线程并行度,让少数线程负责并行度低的算子,多数线程负责并行度高的算子。例如 Shared expert 与 EP 通信同时进行,实测显示,MoE 推理时延从 1440μs 大幅降低至 980μs。

2. 面向“灵晟”集群的多层次并行推理优化

LX2 CPU 采用 NUMA 架构并集成片上内存,结合“灵启”网络的强劲互联能力,与 DeepSeek 大 EP(Expert Parallelism,专家并行)架构天然契合,具备极佳的集群扩展性。

基于此,清程极智实施了多维度的并行策略优化:灵活配置张量并行(TP)、流水线并行(PP)、专家并行(EP)及数据并行(DP),构建多层次混合并行推理方案。

在 DeepSeek 部署上,团队采用 EP256 的大规模专家并行配置,专家权重全量分散部署,节点内 TP16,节点间 DP16,并针对 Attention 模块设计定制化混合并行策略,充分释放了 LX2 平台的算力密度与通信能力。

3. MTP(Multi-Token Prediction)技术加持

在上述优化基础上,清程极智引入 DeepSeek MTP 加速技术,一次推理产生多个 token,再并行验证每个 token 是否正确,显著提升了单请求的输出速率。团队还深入探究了不同并发规模下 MTP 加速比与预测深度的相关性,持续调优以实现最佳推理效果。

打破边界:引领超智融合新范式

基于“灵晟”多样性算力架构的创新与清程极智的 AI 推理加速技术,成功实现了 DeepSeek 模型的高效部署,率先实现纯 CPU MoE 模型分布式推理。16 节点即可流畅运行 DeepSeek-V3/R1-671B 模型,在 batch_size=2048 时,输出吞吐量与 80 张主流 GPU 集群相当。

从技术突破到高质量"Token 服务”交付

此次灵晟超算合作落地的技术成果,绝非单次偶然的技术攻关,而是国产算力软硬结合价值的有力印证,更是清程极智长期深耕国产化算力适配、持续打磨 AI 推理工程能力的必然结果,全方位彰显了公司成熟的国产算力 Token 量产与交付实力。

当前国产算力产业已迈入新阶段,行业核心痛点早已从“有无算力硬件”转向“能否将硬件算力转化为稳定、高效、可落地的 Token 服务”。

单纯的硬件峰值算力指标无法真实反映实际 AI 生产力。只有通过深度的软件适配、算子优化、通信协同与并行策略重构,才能打通硬件算力到大模型 Token 服务的完整链路,让国产算力从硬件资源真正转化为可商用、高性价比的 AI 生产力,这正是软硬协同融合的核心意义与产业价值。

本次纯 CPU MoE 模型分布式推理方案的成功落地,核心依托两大支撑:一是灵晟超算原生超智融合的国产化硬件底座,LX2 CPU、片上高带宽内存与灵启超低时延网络,构建了适配大模型推理的优质国产硬件体系;二是清程极智多年深耕国产化赛道的技术积淀。

相较于行业通用的适配移植模式,清程极智始终立足国产算力架构特性做原生优化,不套用海外 GPU 适配逻辑,长期深耕国产 CPU、国产超算及其他国产算力的推理适配、算子迭代、集群并行优化等核心技术,积累了一套成熟、适配各类国产异构算力的系统化优化方法论。

依托长期的国产化技术积淀,清程极智具备了完整的国产算力 Token 工厂量产交付能力。不同于碎片化的技术优化,清程打造的是一套从硬件适配、软件优化、算力调度到 Token 高效产出的全链路系统化能力。

本次合作中,清程团队针对灵晟硬件特性完成算子重构、计算通信协同优化、多层次混合并行部署与 MTP 技术叠加加速。这并非零散的技术叠加,而是精准适配国产超算架构的成套工程化落地,成功将灵晟超算的硬件算力潜力,高效转化为高吞吐、低时延、可扩展的 Token 生产产能,让国产超算摆脱传统科学计算的单一用途,正式纳入大模型 AI 服务的生产体系。

所谓"Token 服务”,核心是跳出传统算力评价思维,摒弃单纯以节点数量、峰值算力为核心的硬件评价标准,建立一套完整的算力生产评价体系:以终端业务可感知的 Token 产出效率、单位算力成本、推理时延、服务稳定性等产业落地维度衡量算力价值。其本质是把零散的算力硬件、模型、软件系统,整合为标准化、可量产、可交付的 AI 生产力。

此次与灵晟超算的深度合作,是清程极智国产化深耕之路的重要标杆性落地。它充分证明,国产自主可控的超算硬件,搭配本土企业深耕打磨的自研推理软件与系统化优化能力,完全能够比肩主流 GPU 集群的大模型推理效能,实现高性能 Token 量产。

同时也印证了清程极智的核心竞争力:不止于单点技术突破,更具备将各类国产算力硬件,标准化、工程化转化为可持续交付的 AI Token 生产力的完整能力。

未来,随着国产算力生态持续完善、异构硬件不断丰富,清程极智将持续依托自身软硬协同优化优势,深化国产化全场景适配能力,拓展更多国产算力载体的 Token 工厂落地场景,推动国产算力从“可用”全面走向“好用、高产、低成本”,为国产 AI 基础设施的规模化商用落地筑牢核心产能根基。

编辑:桃子

【声明】内容源于网络
0
0
新智元
智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
内容 16466
粉丝 0
新智元 智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
总阅读339.9k
粉丝0
内容16.5k