大数跨境

老黄最担心的事还是发生了?DeepSeek开始帮华为拆CUDA的墙

老黄最担心的事还是发生了?DeepSeek开始帮华为拆CUDA的墙 全球风口
2026-10-04
27
导读:老黄慌了?

DeepSeek与华为联手:AI重构芯片生态壁垒

近期,AI领域备受关注的动态莫过于DeepSeek与华为的深度合作。9月30日,双方宣布围绕昇腾AI芯片开源一系列编程基础设施,包括计算库、通信库,并推进基于128颗昇腾950的Supernode(超节点)方案。其中,旨在简化AI芯片编程的高层语言TileLang尤为引人注目。

业界有观点认为“英伟达最担心的事发生了,华为即将攻破CUDA生态”。然而,深入分析可见,这并非简单的国产替代故事,而是AI时代产业范式加速演变的缩影:AI技术正在降低追赶旧壁垒的成本,同时将竞争推向超节点、AI工厂及更完整的产业生态维度。

7月前哨专题《国产AI芯片产业链扫描》PPT

DeepSeek为何下场助力华为软件生态?

AI芯片的高效运行依赖于多层软件栈的支持。DeepSeek此次开放的基础设施主要解决以下核心问题:

填补计算与通信的软件鸿沟

首先,硬件性能释放依赖高度优化的Kernel(计算内核)。普通代码往往仅能发挥芯片一半性能,而针对矩阵乘法、Attention、量化及MoE路由等基础操作进行深度优化的Kernel,可将硬件利用率提升至八九成以上。DeepSeek开放计算库,意在弥补这一巨大的“软件差距”。

其次,大模型训练与推理需要海量数据在成百上千张芯片间交换。若通信库优化不足,多卡集群将如同“互相堵车的小岛”。DeepSeek开放通信库并联合华为推进128颗昇腾950组成的Supernode方案,正是为了解决“一群芯片如何协同工作”的问题。

华为昇腾950超节点

TileLang:抽象底层复杂度的关键

CUDA的壁垒在于英伟达近二十年来构建的成熟软件栈。DeepSeek推出的TileLang试图进一步抽象化:开发者只需描述计算逻辑和数据关系,编译器即可将其翻译为适配不同硬件的底层实现。目前,TileLang已支持CUDA、ROCm、Metal等后端,并针对华为昇腾推出了TileLang-Ascend适配。

此外,DeepSeek基于TileLang开源了包含MoE路由、量化等高性能算子的TileKernels库。这表明角色正在发生转变:过去是模型公司适配芯片,如今模型公司凭借对真实负载的理解,反向参与定义下一代芯片的使用方式。

AI成为瓦解CUDA壁垒的新利器

利用AI开发“运行AI的软件”,已成为全球芯片行业的共同趋势,不仅限于中国。

AMD的智能体迁移策略

AMD正将Agent引入软件生态构建流程。其MOAT工具可调动多个智能体自动阅读、迁移、审查和测试CUDA项目。新推出的ROCm.AI开发环境允许Claude、Codex等AI助手直接调用技能,协助开发者部署模型及优化性能。Anthropic与AMD的合作协议中更明确提到,Claude将协助优化GPU工作负载,加速ROCm开发。

AMD ROCm.AI智能体开发工作流

行业通用的抽象化趋势

Modular通过Mojo语言和MAX平台,致力于屏蔽不同芯片间的差异;OpenAI的Triton框架也朝此方向演进,甚至英伟达自身也为Triton提供CUDA后端支持。Google发布的JAXBench基准,更是专门测试AI Agent自主优化TPU底层Kernel的能力。这些举措共同指向一个事实:锁定开发者的CUDA软件壁垒,正被AI技术快速拆解。

Mojo跨不同GPU硬件运行示意

竞争单位升级:从单点突破到生态对决

DeepSeek与华为的合作揭示了AI产业竞争的深层逻辑变化。英伟达的护城河已从单一的GPU或CUDA,扩展至NVLink、NVSwitch、网络架构、机架乃至AI Factory全链路。

2023年6月《英伟达&AI芯片企业分析》专题PPT

当前的AI竞争已非单一企业间的对抗,而是生态系统之间的博弈。各方在争夺标准、入口和利润的同时,也在不同层级展开合作。未来胜负的关键,在于谁能构建一个迭代更快、成本更低、协同效率更高的,集模型、芯片、软件、开发者与应用于一体的完整生态。

透过现象看本质,技术变革后新产业壁垒的形成过程,才是观察科技产业价值的核心所在。

【声明】内容源于网络
0
0
全球风口
全球科技创新产业专家、海银资本创始合伙人、前哨科技特训营主理人王煜全的自媒体平台。
内容 3394
粉丝 1
全球风口 全球科技创新产业专家、海银资本创始合伙人、前哨科技特训营主理人王煜全的自媒体平台。
总阅读93.1k
粉丝1
内容3.4k