大数跨境

DeepSeek 开源算子工具大礼包,联手华为昇腾,手撕 CUDA 绑定!

DeepSeek 开源算子工具大礼包,联手华为昇腾,手撕 CUDA 绑定! AI科技评论
2026-09-30
3
导读:一套代码能跑遍所有芯片。
一套代码能跑遍所有芯片。

    作者丨高允毅

    编辑丨岑   峰

                                                                                                       

DeepSeek 近期完成一项开源壮举:将专为英伟达 GPU 设计的工具链,完整移植至华为昇腾 950 NPU。
核心算子开发产品 TileLang 宣布原生支持昇腾,同时 DeepGEMM、DeepEP、FlashMLA、TileKernels、DeepSelect 五大核心计算与通信库同步推出昇腾版本,直接对标英伟达平台全套工具链。
这意味着国产算力首次在核心算子工具层面,实现与英伟达生态的能力对标。
此前全球 AI 行业长期受困于 CUDA 垄断,如今 DeepSeek 通过开源代码,为国产算力自主生态开辟了新路径。

01


终结算子开发的“手工作坊”时代

在 AI 底层开发中,“写算子”是门槛极高且耗时的工作。若底层算子优化不足,芯片内部计算单元将因等待数据流转而闲置,导致高性能芯片利用率仅 20% 左右。算子优化的目标是将硬件利用率提升至 95% 以上。
以常见的矩阵乘法(GEMM)为例,开发者需手动管理三级缓存、调度线程块、处理数据预取及指令重排。资深工程师往往需数周打磨上千行代码。这导致模型算法迭代速度远超芯片厂商官方算子库的更新速度。
传统行业解决方案存在局限:
手写 CUDA:性能最高,但开发效率低,深度绑定英伟达生态,无法跨平台;
厂商预制算子库:如 cuBLAS,开箱即用但灵活性差,不支持算子融合,难以适配新算法;
高层 DSL 编译器:如 Triton,降低门槛但性能受限,对非英伟达硬件支持不足,异构适配成本高。
TileLang 开辟了第四条路,兼顾开发灵活性、运行性能与跨平台能力,终结“手工作坊”模式。
其核心采用多级分块(Tiling)技术,将计算任务切分为标准化数据块。开发者只需声明数据计算位置,编译器自动处理数据搬运与线程同步,性能逼近手写 CUDA 上限。
TileLang 主攻大模型核心算子:通用矩阵乘法、反量化 GEMM、FlashAttention、线性注意力及稀疏 MLA。这些算子承载大模型训练和推理 90% 以上的计算量,直接决定算力利用率。
算子效率提升直接降低训练成本并提升推理效率。DeepSeek 能将 API 价格降至行业极致,除模型架构优势外,也得益于底层高效的 TileLang 工具链。

02


基于 TVM 架构,性能跻身全球第一梯队

技术上,TileLang 复用Apache TVM编译能力。TVM 作为 Apache 顶级项目,扮演 AI 芯片与大模型间的“翻译官”角色,能将上层框架编译为适配底层芯片的高性能机器码。
TileLang 在 TVM 基础上封装简易语法,专注大模型分块计算。开发者无需关注底层硬件细节,即可通过少量代码释放芯片极限算力。
TileLang 由北京大学团队孵化,DeepSeek 将其推向生产环境并反向捐赠开源社区。截至 2026 年 9 月,该项目已成为国产 DSL 标杆。
基准数据显示:基于 TileLang 优化的 DeepSeek V3.2 稀疏注意力 TopK 算子,比原生 PyTorch 快 2–20 倍;其 MLA、FlashAttention 等核心算子均已提供商用级优化实现。
在英伟达 H100 上,TileLang 速度大幅超越 Meta 的 PyTorch 原生实现,并击败 OpenAI 的主力加速工具 Triton。
图注:H100 上各底层框架的 MLA 解码性能对比,相比传统和通用框架,FlashMLA 与 TileLang 具备极佳的硬件算力释放效率
TileLang 甚至追平英伟达官方调校的 cuBLAS 及 FlashAttention,进入全球顶尖性能第一梯队。
不同于仅支持自家芯片的英伟达官方工具,TileLang 具备跨平台能力,在 AMD MI300X 上同样取得接近硬件极限的性能。

03


架构深度拆解:前后端解耦实现跨芯片兼容

TileLang 采用“前后端解耦,目标与执行分离”架构,解决传统编译器换芯片需推倒重来的痛点:
  • 目标后端:定义硬件指令语法与优化规则,属硬件专属部分;
  • 执行后端:负责通用编译、加载与启动流程,与具体硬件无关。
适配新芯片时,只需新增目标后端,执行后端无需改动。目标后端遵循四层流水线结构:
语言方言(Dialect):将代码翻译为特定芯片指令,如 CUDA 后端的 WGMMA/TCGEN05,AMD ROCm 的 MFMA/WMMA,以及华为昇腾的 Ascend C 向量与矩阵指令。
上下文贡献(Context):感知当前运行芯片,统一转换硬件规格参数,记录编译状态。
Pass 流水线(Pass Pipeline):核心翻译优化环节,将高层逻辑转换为底层代码并进行针对性优化。
主机/设备代码生成(Codegen):拆分主机侧(CPU 任务调度)与设备侧(AI 加速器核心计算)代码,完成最终编译执行。
目前,TileLang 已覆盖英伟达 CUDA、AMD ROCm、苹果 Metal、华为昇腾 950 等主流平台,并正在适配沐曦、摩尔线程、海光等国产芯片。
该架构允许开发者通过简洁 Python 语法,显式控制存储、线程调度与并行节奏:
  • 存储控制:决定数据在全局内存、共享内存或寄存器中的存放位置,减少等待闲置;
  • 线程调度:精准分配计算任务至芯片核心,实现多路并行;
  • 并行节奏:通过软件流水线实现数据搬运与计算异步并行。
借助这三个维度,传统需 500 行以上的 CUDA 代码,可压缩为 30 多行 Python 代码。

04


押注华为昇腾:DeepSeek 的战略赌注

DeepSeek 创始人梁文锋将“使用华为或其他国产芯片训练模型”视为公司“最大的赌注之一”,并强调此役“必须成功”。
据悉,DeepSeek 已投入 25.6 亿美元采购至少 16 万颗华为昇腾 950DT 加速器,用于内蒙古乌兰察布数据中心建设,预计 2026 年 Q4 开始交付。这批芯片主要面向推理侧,训练环节仍依赖英伟达。
DeepSeek 将国产芯片置于核心战略位,旨在率先适应英伟达之外的半导体硬件。然而,转向昇腾面临三大难关:
训练软件栈重写:需将基于英伟达 Tensor Core/Hopper 架构的代码替换为 Ascend C/HCCL,并逐一验证自研核心算子在昇腾上的性能。
通信原语替换:从 NCCL 迁移至 HCCL 涉及 API 设计、性能曲线及容错模型的差异,适配偏差可能导致训练失效。
芯片产能风险:受美国出口管制影响,华为 Ascend 950 产能面临挑战。DeepSeek 押注的前提是华为 Q4 交付顺利。
DeepSeek 正训练一款 2 万亿参数大模型,并规划 8 万亿参数模型。据估算,训练同级别大模型需约 20 万颗昇腾 950 芯片。尽管供货仍有缺口,DeepSeek 仍通过多轮融资持续投入算力扩张。
未来 12 个月,四个变量将决定这场赌局的胜负:华为 Ascend 950 交付率、TileLang 昇腾后端追赶 CUDA 的速度、其他大厂是否跟随押注昇腾,以及美国出口管制政策变化。
TileLang 的开源将“国产算力生态建设”从工程问题转化为生态问题。与闭源绑定的 CUDA 不同,TileLang 作为开源、跨硬件的工具,专注解决大模型核心算子开发,大幅降低国产芯片适配成本,加速生态迭代。
DeepSeek 证明了利用国产芯片构建世界级超算集群的可行性。在算力成本与供应链安全的深水区,“用软件定义算力”正通过 TileLang 等底层创新,重构国产算力生态格局。
参考链接:https://github.com/tile-ai/tilelang
https://www.theinformation.com/articles/deepseek-bets-big-huawei-chips-bypass-u-s-export-controls?utm_campaign=Editorial&utm_content=Article&utm_medium=organic_social&utm_source=threads,twitter&__cf_chl_rt_tk=iW7ZBFXRrEVuB9NBtCSW3X3dfxuUsmhAeiCUuxwa9RI-1790041475-1.0.1.1-NZ2.jEQlxsBBSsJDT6m6kKkiC9ImC8gHkVtqSlKM8iI
【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容 8980
粉丝 0
AI科技评论 聚焦AI前沿研究,关注AI工程落地。
总阅读260.0k
粉丝0
内容9.0k