不是我硬件不好
是你软件架构有硬伤
🔥OpenAI为了自研芯片Jalapeño,最近与英伟达撕破脸,指责其warp、L2缓存和统一内存设计只为追求纸面数据,实际AI推理场景,硬件空转性能白白浪费超9成!
现在,英伟达的反击来了!直接挑明
——不是我硬件设计不行,而是你AI模型架构设计有问题!
NVIDIA 联合 MIT 等团队扔出一篇论文《SparDA: Sparse Decoupled Attention for Efficient Long-Context LLM Inference》(arXiv:2606.04511)。表面上看,只是给 Transformer 每一层多加了一个叫 “Forecast” 的投影,却让长上下文推理在解码阶段快了最高 1.7 倍,同时长推理准确率还能再涨 6.5 个点。参数量增加不到 0.5%,训练也只动新加的那一小部分权重。
新技术的重点:就是能解决OpenAI所指控的,AI推理过程中,硬件空转等待数据的问题。有望发挥英伟达GPU 100%实力!
先把痛点讲透:稀疏注意力还是卡在两道坎上
现代大模型越来越依赖超长上下文——Agent 要记住整个对话轨迹、复杂推理要跨几十万 token 拉线索。标准注意力的 KV Cache 会线性膨胀,到 100K 以上基本塞不进单卡显存,只能把大部分缓存扔到 CPU 内存,需要时再通过 PCIe 搬回来。
稀疏注意力(比如 InfLLM-V2、NSA 这类块级稀疏)已经大幅砍掉了计算量和带宽:只挑 top-k 个关键块做注意力。但两个老问题依然顽固存在:
- 搬数据的延迟无法被掩盖
每一层都要等自己的 Query 算出来,才能决定该搬哪些 KV 块。等选定了再去 CPU 取,GPU 只能干等。上下文越长,这个“等”的代价越明显。 - 选择本身变成新瓶颈
标准做法要用每个 Query 头去给所有候选块打分、做 softmax,再汇总。解码阶段 Query 只有一个 token,注意力本身已经很便宜,但选择过程的复杂度仍随上下文长度增长,最后反客为主。
根源很简单:选择逻辑被绑死在当前层的 Query 上。Query 还没算出来,就没法提前知道下一层要什么。
SparDA 的解法:把选择从 Query 上解耦,再往前看一层
SparDA 的核心改动只有一处——每层不再只产出 Q、K、V,而是多产出一个 Forecast 投影。
- 当前层的 Forecast 负责预测“下一层大概会需要哪些 KV 块”。
- 下一层用自己的真正 Query 去对这些已经选好的块做稀疏注意力。
这一层“提前量”带来两个直接收益:
- 运行时可以在当前层还在算的时候,就用独立 CUDA Stream 把下一层需要的块从 CPU 预取到 GPU。计算与数据搬运重叠,GPU 几乎不再空转。
- Forecast 本身不必保留完整的多头结构。在 GQA 分组里,每个组只需要一个 Forecast 头就能完成选择,彻底省掉按头打分和 softmax 的开销。
参数代价极低:在 8B 模型上只多了约 3300 万参数(0.41%)。训练时冻结原模型,只用 KL 散度让 Forecast 的块分布去逼近原稀疏选择器的分布即可。
论文在 MiniCPM4.1-8B 和 NOSA-8B 两个已经做过稀疏预训练的模型上验证:
- 准确率持平或略升,其中 NOSA-8B 在长推理任务上直接 +6.5 分。
- Prefill 最高 1.25× 加速,Decode 最高 1.7× 加速(相对带 offload 的稀疏基线)。
- 因为大部分 KV 可以安心住在 CPU,GPU 显存被腾出来,能塞更大的 batch,最终 Decode 吞吐量最高比“不 offload 的稀疏方案”高 5.3×。
注意:这个预取红利主要体现在 Decode + CPU offload 场景。Prefill 阶段 KV 本来就在 GPU 上,收益主要来自更轻量的选择本身。
和现有工作的关系
DeepSeek 的 DSA 已经把“选择”从 Query 上拆出来,用独立 indexer 选 token。SparDA 把同样的思想搬到块级稀疏,并且额外解决了“提前预取”的系统问题。它也比 InfiniGen 那种用原始隐藏状态当代理的方法更准——因为 Forecast 是专门训练出来预测下一层选择分布的。
代码已经开源在 GitHub(NVlabs/SparDA),支持在现有稀疏模型上直接训练 Forecast。
硅基观点
大模型推理的瓶颈正在从“算力够不够”转向“数据怎么更快地出现在算力面前”。SparDA 没有发明新的注意力公式,也没有引入复杂的门控或压缩,只是把“选择”这个动作从关键路径上挪开,再往前看一层。
这种“解耦 + 提前量”的思路很干净。它提醒我们:很多系统瓶颈其实藏在架构的隐性耦合里。当上下文继续往百万 token 级别走、当 Agent 需要持续长程记忆时,类似 Forecast 这样的轻量前瞻机制,很可能成为标配。
当然,目前收益高度依赖 Decode + offload 场景,且需要模型本身已经是稀疏预训练的。但作为“只加 0.4% 参数就能同时提速又提准”的案例,它已经足够漂亮。
未来如果能把 Forecast 的预测范围从“下一层”扩展到“下几层”,或者和动态稀疏、量化进一步叠加,长上下文服务的性价比还会再上一层。
文末点击下一篇或者扫码加入学习群,即可学习前沿AGI常识。
💡阅读更多:
欢迎大家关注AI顿悟涌现时,快速入门当下最热的AI大模型前沿。
AI顿悟涌现时
AI顿悟涌现时是红绿旗下关注新技术的内容品牌。 AI顿悟涌现时关注前沿技术的发展应用,深度解读新技术对商业模式和社会形态的变革。 大模型商业技术及通识,筹备开课,欢迎有授课能力的朋友合作,欢迎有兴趣的朋友报名一起学习。相关优质内容将会发布在下方动图内微信公众号▼▼

