大数跨境

反击OpenAI!NVIDIA 给 Transformer 加了第四个投影:解码提速 1.7 倍,长推理还涨了 6.5 分

反击OpenAI!NVIDIA 给 Transformer 加了第四个投影:解码提速 1.7 倍,长推理还涨了 6.5 分 AI顿悟涌现时
2026-09-08
2
导读:🚀 NVIDIA 稀疏注意力新架构 SparDA 详解,通过 Forecast 投影实现选择与注意力解耦 + 异步预取,如何用轻量 Forecast 投影同时解决长上下文的选择瓶颈和数据搬移瓶颈,开

不是我硬件不好

是你软件架构有硬伤


🔥OpenAI为了自研芯片Jalapeño,最近与英伟达撕破脸,指责其warp、L2缓存和统一内存设计只为追求纸面数据,实际AI推理场景,硬件空转性能白白浪费超9成!

现在,英伟达的反击来了!直接挑明

——不是我硬件设计不行,而是你AI模型架构设计有问题!

NVIDIA 联合 MIT 等团队扔出一篇论文《SparDA: Sparse Decoupled Attention for Efficient Long-Context LLM Inference》(arXiv:2606.04511)。表面上看,只是给 Transformer 每一层多加了一个叫 “Forecast” 的投影,却让长上下文推理在解码阶段快了最高 1.7 倍,同时长推理准确率还能再涨 6.5 个点。参数量增加不到 0.5%,训练也只动新加的那一小部分权重。

新技术的重点:就是能解决OpenAI所指控的,AI推理过程中,硬件空转等待数据的问题。有望发挥英伟达GPU 100%实力!

先把痛点讲透:稀疏注意力还是卡在两道坎上

现代大模型越来越依赖超长上下文——Agent 要记住整个对话轨迹、复杂推理要跨几十万 token 拉线索。标准注意力的 KV Cache 会线性膨胀,到 100K 以上基本塞不进单卡显存,只能把大部分缓存扔到 CPU 内存,需要时再通过 PCIe 搬回来。

稀疏注意力(比如 InfLLM-V2、NSA 这类块级稀疏)已经大幅砍掉了计算量和带宽:只挑 top-k 个关键块做注意力。但两个老问题依然顽固存在:

  1. 搬数据的延迟无法被掩盖
    每一层都要等自己的 Query 算出来,才能决定该搬哪些 KV 块。等选定了再去 CPU 取,GPU 只能干等。上下文越长,这个“等”的代价越明显。
  2. 选择本身变成新瓶颈
    标准做法要用每个 Query 头去给所有候选块打分、做 softmax,再汇总。解码阶段 Query 只有一个 token,注意力本身已经很便宜,但选择过程的复杂度仍随上下文长度增长,最后反客为主。

根源很简单:选择逻辑被绑死在当前层的 Query 上。Query 还没算出来,就没法提前知道下一层要什么。

SparDA 的解法:把选择从 Query 上解耦,再往前看一层

SparDA 的核心改动只有一处——每层不再只产出 Q、K、V,而是多产出一个 Forecast 投影。

  • 当前层的 Forecast 负责预测“下一层大概会需要哪些 KV 块”。
  • 下一层用自己的真正 Query 去对这些已经选好的块做稀疏注意力。

这一层“提前量”带来两个直接收益:

  • 运行时可以在当前层还在算的时候,就用独立 CUDA Stream 把下一层需要的块从 CPU 预取到 GPU。计算与数据搬运重叠,GPU 几乎不再空转。
  • Forecast 本身不必保留完整的多头结构。在 GQA 分组里,每个组只需要一个 Forecast 头就能完成选择,彻底省掉按头打分和 softmax 的开销。

参数代价极低:在 8B 模型上只多了约 3300 万参数(0.41%)。训练时冻结原模型,只用 KL 散度让 Forecast 的块分布去逼近原稀疏选择器的分布即可。

论文在 MiniCPM4.1-8B 和 NOSA-8B 两个已经做过稀疏预训练的模型上验证:

  • 准确率持平或略升,其中 NOSA-8B 在长推理任务上直接 +6.5 分。
  • Prefill 最高 1.25× 加速,Decode 最高 1.7× 加速(相对带 offload 的稀疏基线)。
  • 因为大部分 KV 可以安心住在 CPU,GPU 显存被腾出来,能塞更大的 batch,最终 Decode 吞吐量最高比“不 offload 的稀疏方案”高 5.3×。

注意:这个预取红利主要体现在 Decode + CPU offload 场景。Prefill 阶段 KV 本来就在 GPU 上,收益主要来自更轻量的选择本身。

和现有工作的关系

DeepSeek 的 DSA 已经把“选择”从 Query 上拆出来,用独立 indexer 选 token。SparDA 把同样的思想搬到块级稀疏,并且额外解决了“提前预取”的系统问题。它也比 InfiniGen 那种用原始隐藏状态当代理的方法更准——因为 Forecast 是专门训练出来预测下一层选择分布的。

代码已经开源在 GitHub(NVlabs/SparDA),支持在现有稀疏模型上直接训练 Forecast。

硅基观点

大模型推理的瓶颈正在从“算力够不够”转向“数据怎么更快地出现在算力面前”。SparDA 没有发明新的注意力公式,也没有引入复杂的门控或压缩,只是把“选择”这个动作从关键路径上挪开,再往前看一层。

这种“解耦 + 提前量”的思路很干净。它提醒我们:很多系统瓶颈其实藏在架构的隐性耦合里。当上下文继续往百万 token 级别走、当 Agent 需要持续长程记忆时,类似 Forecast 这样的轻量前瞻机制,很可能成为标配。

当然,目前收益高度依赖 Decode + offload 场景,且需要模型本身已经是稀疏预训练的。但作为“只加 0.4% 参数就能同时提速又提准”的案例,它已经足够漂亮。

未来如果能把 Forecast 的预测范围从“下一层”扩展到“下几层”,或者和动态稀疏、量化进一步叠加,长上下文服务的性价比还会再上一层。

文末点击下一篇或者扫码加入学习群,即可学习前沿AGI常识。


💡阅读更多:

Linux 7.0 正式亮相!Rust 永驻 性能狂飙 50-75%,Ubuntu 26.04 要迎来“质变”了? 
别沉迷iPhone了!Steam正在成为下一个苹果!
NVIDIA N1 笔记本主板曝光:Arm + Blackwell 的野心初现
Wintel联盟不再!intel深度投入Linux生态,扶持Omarchy

欢迎大家关注AI顿悟涌现时,快速入门当下最热的AI大模型前沿。

原来人类的本质就是AGI
不用看数字的数学,让人高兴 人类大脑真是个奇迹

AI顿悟涌现时推出了【AGI常识】专题。【AGI常识】专题会以最通俗易懂的解释,帮你在一分钟内学会一个新技术名词背后的原理。欢迎点击下方动图,持续关注。

AI顿悟涌现时

AI顿悟涌现时绿旗下关注新技术的内容品牌。
AI顿悟涌现时关注前沿技术的发展应用,深度解读新技术对商业模式和社会形态的变革
大模型商业技术及通识,筹备开课,欢迎有授课能力的朋友合作,欢迎有兴趣的朋友报名一起学习。相关优质内容将会发布在下方动图内微信公众号▼▼

关注AGI ▶▶学习直达▶▶

【声明】内容源于网络
0
0
AI顿悟涌现时
全网唯一零门槛大模型科普!GenAI生成式大模型重塑互联网,世界模型重塑现实世界,硅基生命改写宇宙……人工智能与AR/MR/XR计算机合流,元宇宙虚拟世界开启超越实物价值。人类历史正在被int8和FP16量化卷积训练推理……
内容 97
粉丝 0
AI顿悟涌现时 全网唯一零门槛大模型科普!GenAI生成式大模型重塑互联网,世界模型重塑现实世界,硅基生命改写宇宙……人工智能与AR/MR/XR计算机合流,元宇宙虚拟世界开启超越实物价值。人类历史正在被int8和FP16量化卷积训练推理……
总阅读372
粉丝0
内容97