(本文阅读时间:10 分钟)
结构化稀疏是提升大模型推理效率的关键方向。当前 GPU 引入的稀疏张量核(Sparse Tensor Core)仅支持 2:4 结构化稀疏,可提供最高 2 倍矩阵运算吞吐。然而,2:4 稀疏要求每 4 个连续权重中恰有两个为零,50% 的剪枝率对大语言模型而言过于激进,即便经过微调,仍可能导致明显的精度损失和能力退化。
相比之下,6:8 等温和稀疏模式能在保持模型能力的同时实现有效压缩,但因不符合硬件支持的 2:4 格式,无法获得加速,其零元素在推理时未能带来计算或带宽节省。在量化精度已覆盖从 16 bit 到 4 bit 丰富选择的背景下,稀疏优化领域在 50% 与 0% 剪枝率之间存在巨大的硬件支持空白。
近日,微软亚洲研究院提出 SlideSparse,首次在 NVIDIA GPU 上使 6:8、4:6、8:10 等温和稀疏模式也能利用稀疏张量核加速,填补了这一技术空白。相关论文已被 ICML 2026 接收。

图 1:SlideSparse 将 6:8 稀疏权重转换为 2:4 兼容格式(左),A100 上不同模型的端到端加速(右)。
滑动窗口分解:让温和稀疏适配稀疏张量核
SlideSparse 的核心思路是将不满足 2:4 约束的稀疏块,分解为若干满足该约束的重叠子块。研究团队将这一策略称为“计算套利”(Computational Arbitrage),即通过适度的数据膨胀换取硬件层面的加速能力,从而释放稀疏张量核的计算潜力。
以 6:8 稀疏为例,一个长度为 8 的权重块包含 6 个非零元素和 2 个零元素。由于零元素位置任意分布,无法直接拆分为两个符合 2:4 约束的子块。对此,SlideSparse 采用滑动窗口策略:使用 3 个大小为 4、步长为 2 的窗口依次滑过这 8 个元素。相邻窗口共享两个位置,当某窗口内非零元素超过两个时,多出的元素恰好位于重叠区域,可被下一个窗口容纳。这一过程利用“抽屉原理”,确保所有非零元素均能被合理分配。

图 2:SlideSparse 对 6:8 稀疏模式进行滑动窗口分解。3 个步长为 2 的重叠窗口覆盖全部 8 个位置。非零元素超出单个窗口容量时,可通过重叠区域分配给相邻窗口。
经过变换,原本 8 个元素扩展为 12 个,维度膨胀 1.5 倍。但由于所有生成的子块均满足 2:4 约束,可直接由稀疏张量核执行。鉴于硬件能提供两倍吞吐,最终可获得约 1.33 倍的理论加速比。论文证明,对于任意 (2N−2):2N 稀疏模式,采用 N−1 个滑动窗口是充分必要条件,该膨胀因子已达理论最优。
值得注意的是,权重侧的滑动变换在离线阶段完成,不增加推理开销。输入侧的重排操作(Activation Lifting)本质是索引映射,已融合至推理过程中已有的逐 token 量化 kernel 内,额外开销极低。整个系统集成于 vLLM 推理框架,仅需少量修改即可启用。
将稀疏扩展为新的推理优化维度
过去几年,大模型推理加速主要沿量化方向演进,从 16 bit、8 bit 到 4 bit 甚至更低精度,各类配置逐步获得硬件支持。相比之下,稀疏优化长期受限于硬件仅支持 2:4 格式,开发者不得不在“无稀疏”和"50% 剪枝”间二选一。而 25%、33% 等温和稀疏比例能更好兼顾性能与压缩率,极具潜力却缺乏支持。
SlideSparse 的出现改变了这一局面。通过将更多稀疏模式映射到稀疏张量核执行,SlideSparse 将稀疏优化从两个极端状态扩展为一系列可灵活选择的配置,使稀疏压缩真正成为与量化压缩并列的重要推理优化维度。

图 3:推理加速的二维空间。横轴表示量化精度(最高 8× 加速),纵轴表示稀疏度(最高 2× 加速)。灰色点标记已有硬件支持,绿色点为 SlideSparse 新增支持的中间稀疏级别。
量化与稀疏是两个相互独立的优化方向,可组合使用。在未来大模型部署中,开发者不仅可调整计算精度,还能根据任务需求灵活选择不同稀疏比例,实现更加细粒度的性能 - 效率权衡。
跨平台验证 SlideSparse 的加速能力
为验证方案通用性,研究员在 6 款 GPU(A100、H100、B200、RTX 4090、RTX 5080、DGX Spark)、5 种精度(FP4、INT8、FP8、BF16、FP16)及 5 个模型(Llama3.2-1B/3B、Qwen2.5-7B/14B、BitNet b1.58 (2B))上进行了评测,覆盖数据中心、消费级和嵌入式三类平台。

图 4:SlideSparse 在不同 GPU 平台上的端到端推理加速表现。上行为 Decode 阶段,下行为 Prefill 阶段。
实验结果表明,在计算密集的 Prefill 阶段,6:8 稀疏能充分发挥稀疏张量核能力。在 A100 上,Qwen2.5-7B 模型实现了 1.33 倍的端到端加速,与理论上限高度一致。
在消费级 GPU 上,SlideSparse 同样展现稳定收益。例如,在 RTX 4090 的 FP8 配置下,6:8 稀疏可实现约 1.18~1.19 倍的加速。Decode 阶段虽受访存瓶颈限制,加速幅度相对较小,但仍可获得 1.07~1.21 倍的性能提升。
在实际服务场景测试中,Qwen2.5-14B 模型的首 token 延迟由 390 ms 降低至 291 ms,进一步验证了 SlideSparse 的实际部署价值。
系统效率分析显示,多数配置下的整体效率超过 100%,表明融合 kernel 的设计有效消除了滑动变换带来的额外开销,并在部分硬件平台上进一步释放了潜在性能。

图 5:算法效率分析。在数据中心 GPU 上,效率均超过 100%,表明融合 kernel 有效消除了额外开销。
重新释放温和稀疏的部署潜力
稀疏张量核是现代 GPU 重要的硬件加速能力,但其应用长期受限于 2:4 结构化稀疏这一单一格式。对于能更好兼顾模型性能与压缩率的温和稀疏配置,硬件支持始终存在缺口。
SlideSparse 通过创新性的滑动窗口分解机制,将稀疏张量核的适用范围扩展至整个 (2N−2):2N 稀疏家族,为温和稀疏提供了切实可行的硬件加速路径。该工作不仅拓宽了结构化稀疏的应用边界,也使稀疏压缩与量化压缩一样,成为大模型推理优化中可灵活调节的重要维度。
相关代码现已开源,并集成于 vLLM。
SlideSparse: Fast and Flexible (2N-2):2N Structured Sparsity (ICML 2026)
论文链接:
https://arxiv.org/abs/2603.05232
代码链接:
https://github.com/bcacdwk/vllmbench
#大模型推理 #稀疏加速 #ICML #结构化稀疏 #vLLM

