LLM推理优化都还没有到头呢,何况DiT 推理优化呢。更准确地说,只是 N卡上一些主流模型的常规优化逐渐成熟了,不过仍然存在很多进一步的空间。但跨模型、跨硬件、跨部署场景的优化才刚开始。
截至 2026 年,刚刚看了一下vLLM-Omni,公开主线中的国产卡有昇腾,也已经有摩尔线程 MUSA。MUSA 已接入 FlashAttention,并验证过 Qwen-Image、Wan2.2、Qwen2.5-Omni 等模型。不过如果看支持深度、模型覆盖和持续维护,昇腾仍然是国产硬件中最完整的一条路径。寒武纪、沐曦、燧原、昆仑芯、天数智芯、壁仞等,目前更多还是厂商框架、插件或独立仓库,还没有在 vLLM-Omni 中形成同等级的主线支持。
但这恰好说明,DiT 优化距离做到头还很远。
以目前生态相对成熟的昇腾为例,vLLM-Omni 已经能复用不少平台无关能力,包括 USP、CFG Parallel、HSDP、TeaCache、Cache-DiT、CPU Offload 和 VAE 并行。它能跑,但优化还不彻底。部分局部能力甚至比 CUDA 更早落地,例如通过 MindIE-SD 实现的 AdaLayerNorm 融合,以及面向 Wan2.2 验证的 MXFP8、MXFP4 权重与激活量化。那问题出在哪儿呢?
问题出在执行栈,目前昇腾的 diffusion 主干不走 torch.compile,DiT 没有完整的ACLGraph/NPUGraph选项,也没有看到图编译及其下沉,主要依赖 eager 执行和单算子性能,Attention 基本只有 MindIE-SD FlashAttention 和 PyTorch SDPA 两条路径,而 CUDA 侧还有 cuDNN、FlashInfer、SageAttention、FA3 等多种选择,Ring Attention、稀疏 Attention、线性 Attention 等长视频优化也没有完整的昇腾实现,部分 RoPE 计算甚至需要把数据搬到 CPU,计算后再传回 NPU。
再往工程层面看,昇腾还有版本严格绑定、厂商扩展需要单独编译、worker 依赖大段 fork-and-patch、CI 和baseline不足等问题,装没装 MindIE-SD,可能直接决定同一份程序走 FlashAttention 还是 SDPA,虽然它们都能跑起来,却会明显影响性能、精度可复现性和升级成本。
如果连国产生态中投入最多、上游参与度最高的昇腾,执行图、Attention、模型覆盖、CI 和性能baseline都还有这么多空白,那么其他国产卡更难说已经进入充分优化阶段。
针对固定硬件和固定模型,厂商完全可能凭借专用算子、编译器和芯片内部信息,做出比通用开源路径更快的版本。真正的问题是,这种性能能否持续:
新模型发布后能不能快速支持;
能不能覆盖不同分辨率、序列长度和并行组合;
算子、编译器和框架升级后会不会失效;
有没有公开测试、CI 和精度基线;
优化能不能被第三方复现和继续维护。
单个私有 benchmark 跑赢一次,与形成一个可持续的软件生态,不是一码事。
不过话说回来,国产卡也并非完全各自为战,PyTorch PrivateUse1、FlagGems、FlagTree、FlagCX 等项目正在尝试提供共同的框架、算子和通信基础。FlagGems 已列出昇腾、寒武纪、昆仑芯、沐曦、摩尔线程、天数智芯等多个后端,不过支持 FP16、BF16 基础算子,只能证明程序具备运行基础,不等于已经具备高性能 DiT 推理所需的 fused norm、量化 GEMM、稀疏 Attention、graph mode、分布式通信。
视频 DiT 中,QKV 投影、FFN、归一化、VAE、通信和 kernel launch 都可能成为瓶颈。接下来仍有很大的空间:
编译与图执行:torch.compile、区域编译、NPU Graph、动态 shape 分桶;
算子融合:Attention、Norm、RoPE、激活与残差融合;
低精度:FP8、INT8、MXFP8、MXFP4,以及权重和激活联合量化;
长序列:Ring、Ulysses、VSA、块稀疏和滑动窗口;
跨步复用:TeaCache、Cache-DiT、特征缓存;
算法减步:蒸馏、少步采样和一致性模型;
系统优化:请求级 batching、异步输出、VAE 并行、流水线与异构调度。
vLLM-Omni 在 2026 年仍然有关于 VSA、INT8 Linear、FastNorm、block-sparse 和 sliding-tile attention 的公开 RFC,说明主流开源项目也并不认为 DiT 优化已经到头。
所以我的判断是DiT 推理优化只是第一阶段快结束了,第一阶段解决能跑和把成熟 CUDA 算子接进来;第二阶段要解决跨硬件、跨模型、跨精度和跨并行策略的稳定高性能。N家生态已经走到第二阶段,昇腾正在补执行层和工程化,其他国产卡多数还处在从能跑到跑快的过渡期。而且最终比拼的也不会只是某一张卡的峰值算力,而是谁能把编译器、算子库、推理框架、模型适配、CI 和开发者社区连成一个可持续迭代的闭环,这条路上还有非常多的事情要做,国产生态的kick off和成熟需要大家的参与:)
DiT 推理优化远没做到头。更准确地说,只是 N卡上一些主流模型的常规优化逐渐成熟了,不过仍然存在很多进一步的空间。但跨模型、跨硬件、跨部署场景的优化才刚开始。
截至 2026 年,刚刚看了一下vLLM-Omni,公开主线中的国产卡有昇腾,也已经有摩尔线程 MUSA。MUSA 已接入 FlashAttention,并验证过 Qwen-Image、Wan2.2、Qwen2.5-Omni 等模型。不过如果看支持深度、模型覆盖和持续维护,昇腾仍然是国产硬件中最完整的一条路径。寒武纪、沐曦、燧原、昆仑芯、天数智芯、壁仞等,目前更多还是厂商框架、插件或独立仓库,还没有在 vLLM-Omni 中形成同等级的主线支持。
但这恰好说明,DiT 优化距离做到头还很远。
以目前生态相对成熟的昇腾为例,vLLM-Omni 已经能复用不少平台无关能力,包括 USP、CFG Parallel、HSDP、TeaCache、Cache-DiT、CPU Offload 和 VAE 并行。它能跑,但优化还不彻底。部分局部能力甚至比 CUDA 更早落地,例如通过 MindIE-SD 实现的 AdaLayerNorm 融合,以及面向 Wan2.2 验证的 MXFP8、MXFP4 权重与激活量化。那问题出在哪儿呢?
问题出在执行栈,目前昇腾的 diffusion 主干不走 torch.compile,DiT 没有完整的ACLGraph/NPUGraph选项,也没有看到图编译及其下沉,主要依赖 eager 执行和单算子性能,Attention 基本只有 MindIE-SD FlashAttention 和 PyTorch SDPA 两条路径,而 CUDA 侧还有 cuDNN、FlashInfer、SageAttention、FA3 等多种选择,Ring Attention、稀疏 Attention、线性 Attention 等长视频优化也没有完整的昇腾实现,部分 RoPE 计算甚至需要把数据搬到 CPU,计算后再传回 NPU。
再往工程层面看,昇腾还有版本严格绑定、厂商扩展需要单独编译、worker 依赖大段 fork-and-patch、CI 和baseline不足等问题,装没装 MindIE-SD,可能直接决定同一份程序走 FlashAttention 还是 SDPA,虽然它们都能跑起来,却会明显影响性能、精度可复现性和升级成本。
如果连国产生态中投入最多、上游参与度最高的昇腾,执行图、Attention、模型覆盖、CI 和性能baseline都还有这么多空白,那么其他国产卡更难说已经进入充分优化阶段。
针对固定硬件和固定模型,厂商完全可能凭借专用算子、编译器和芯片内部信息,做出比通用开源路径更快的版本。真正的问题是,这种性能能否持续:
新模型发布后能不能快速支持;
能不能覆盖不同分辨率、序列长度和并行组合;
算子、编译器和框架升级后会不会失效;
有没有公开测试、CI 和精度基线;
优化能不能被第三方复现和继续维护。
单个私有 benchmark 跑赢一次,与形成一个可持续的软件生态,不是一码事。
不过话说回来,国产卡也并非完全各自为战,PyTorch PrivateUse1、FlagGems、FlagTree、FlagCX 等项目正在尝试提供共同的框架、算子和通信基础。FlagGems 已列出昇腾、寒武纪、昆仑芯、沐曦、摩尔线程、天数智芯等多个后端,不过支持 FP16、BF16 基础算子,只能证明程序具备运行基础,不等于已经具备高性能 DiT 推理所需的 fused norm、量化 GEMM、稀疏 Attention、graph mode、分布式通信。
视频 DiT 中,QKV 投影、FFN、归一化、VAE、通信和 kernel launch 都可能成为瓶颈。接下来仍有很大的空间:
编译与图执行:torch.compile、区域编译、NPU Graph、动态 shape 分桶;
算子融合:Attention、Norm、RoPE、激活与残差融合;
低精度:FP8、INT8、MXFP8、MXFP4,以及权重和激活联合量化;
长序列:Ring、Ulysses、VSA、块稀疏和滑动窗口;
跨步复用:TeaCache、Cache-DiT、特征缓存;
算法减步:蒸馏、少步采样和一致性模型;
系统优化:请求级 batching、异步输出、VAE 并行、流水线与异构调度。
vLLM-Omni 在 2026 年仍然有关于 VSA、INT8 Linear、FastNorm、block-sparse 和 sliding-tile attention 的公开 RFC,说明主流开源项目也并不认为 DiT 优化已经到头。
所以我的判断是DiT 推理优化只是第一阶段快结束了,第一阶段解决能跑和把成熟 CUDA 算子接进来;第二阶段要解决跨硬件、跨模型、跨精度和跨并行策略的稳定高性能。N家生态已经走到第二阶段,昇腾正在补执行层和工程化,其他国产卡多数还处在从能跑到跑快的过渡期。而且最终比拼的也不会只是某一张卡的峰值算力,而是谁能把编译器、算子库、推理框架、模型适配、CI 和开发者社区连成一个可持续迭代的闭环,这条路上还有非常多的事情要做,国产生态的kick off和成熟需要大家的参与:)

