大数跨境

昇腾快速适配DeepSeek V4.1 Flash,释放模型推理潜能

昇腾快速适配DeepSeek V4.1 Flash,释放模型推理潜能 昇腾AI开发者
2026-09-11
3

2026年9月10日,深度求索正式发布并开源DeepSeek V4.1 Flash模型。作为DeepSeek全新模型结构系列中最小尺寸的模型,具备原生多模态视觉理解能力。此次DeepSeek V4.1 Flash一经开源发布,昇腾即实现快速支持,围绕模型架构与硬件特性,构建统一的协同推理优化方案。目前,昇腾Atlas 800系列产品以及Atlas 900 A3 SuperPod超节点已经支持V4.1 Flash基于vLLM Ascend进行推理部署,昇腾950液冷、风冷超节点也已完成该模型基于SGLang开源推理引擎的推理适配。


DeepSeek V4.1 Flash:小成本大智能


DeepSeek V4.1 Flash为552B参数的MoE模型,采用了全新的Causal-Encoder-Decoder 结构,输入和输出不对称,输入激活只有8B,输出激活16B,成本显著低于已知的同尺寸模型。同时,V4.1 Flash还采用了新的预训练方式、经过了更大规模的强化学习后训练,在基准测试中,成功超越了包括DeepSeek V4 Pro在内的一众旗舰模型的智能水平。


DeepSeek-V4.1-Flash与主流前沿模型在Agentic Benchmark上的性能对比


同时,DeepSeek V4.1 Flash大幅减少了KV Cache缓存的大小,与上一代模型相比,对片上内存的需求减少到1/4,对SSD的需求减少到1/8。在Agent使用场景中,缓存命中的费用往往占比较高,对KV Cache的压缩大幅降低了Agent类任务的使用成本。


昇腾:协同优化,释放推理潜能


面向长上下文、多模态与智能体应用,DeepSeek V4.1 Flash的推理部署对计算效率、存储能力和服务响应提出了更高要求。昇腾基于vLLM Ascend、SGLang,围绕模型架构与硬件特性协同优化,面向昇腾Atlas 800系列产品、Atlas 900 A3 SuperPod超节点及昇腾950液冷、风冷超节点构建统一的推理优化方案。从Ascend C与Triton融合算子,到多流并行、计算空泡优化,再到DSpark投机解码、NPU Graph图执行与Engram分片存储,持续打通模型、算子和推理框架之间的优化链路,为新一代大模型部署提供高效算力支撑。


Ascend C与Triton协同,打造高性能融合算子体系


针对DeepSeek V4.1 Flash的稀疏注意力、模型连接结构与混合专家网络,昇腾适配方案深入核心计算链路,结合CANN算子能力与Triton编程,将分散的计算和数据处理整合为更高效的执行过程。



SparseFlashMLA与QLI V2稀疏计算加速:协同优化滑窗注意力、长上下文稀疏计算与候选块筛选,提高有效计算效率,让更多算力用于真正参与模型推理的内容。


Triton融合Kernel加速:围绕查询量化、索引处理和状态压缩等高频操作开展融合优化,减少小算子调度与中间数据搬运,实现关键融合算子(compressor、engram等)优化其中,Indexer查询量化在专项测试中实现最高约9.5倍加速,索引后处理在多组专项测试场景下实现数十倍加速


mHC深度融合与序列并行:围绕模型连接结构、归一化与精度转换,构建更紧凑的计算链路,引入序列并行降低冗余计算和通信,该计算环节耗时降低约37%。


MoE专家路由优化:围绕Hash TopK专家选择,优化路由前处理与精度传递,减少跨层重复操作。其中,路由前处理复用优化在局部路由链路测试中实现约20%的耗时下降。


从核心注意力到专家路由,从融合计算到数据搬运优化,多层次算子协同使DeepSeek V4.1 Flash的架构特点与昇腾硬件能力更紧密地结合。


多流并行与图执行协同,减少计算空泡与调度开销


推理效率不仅取决于算子的执行速度,也取决于算子之间如何衔接。昇腾适配方案将优化深入到执行时序、图运行与推理调度,减少计算单元的等待,让各阶段衔接得更紧密。



Vector/Cube多流并行与空泡优化:结合昇腾向量与矩阵计算单元的特点,通过多流调度组织计算与访存交叠,减少串行等待和计算空泡,提高硬件资源利用效率。


NPU Graph图执行优化:将解码阶段的计算纳入图执行,结合持久化缓冲区和输出复用,减少重复调度、临时分配与数据拷贝,使高频解码过程更紧凑。


DSpark投机解码支持:接入草稿生成与目标模型验证链路,协同处理缓存共享与状态衔接,为提高token生成效率提供加速路径。


通过算子执行、图运行与调度策略的协同设计,适配方案从多个层面压缩推理过程中的非计算开销,持续挖掘硬件与模型的性能潜力。


混合缓存与Engram分片,拓展复杂场景部署能力


长上下文与多模态应用,对推理系统提出了更高的存储和数据管理要求。昇腾适配方案将混合缓存、分布式存储与服务接入统一考虑,为复杂模型的部署提供更完整的支撑。



Hybrid KV Cache混合缓存管理:协同管理滑窗、长上下文和索引缓存,结合跨层共享、前缀复用与FP32环形状态管理,减少重复计算和数据冗余,为长文档处理、多轮交互等场景提供支持。


Engram 存储优化:通过定制模块TP,构建Host Offload能力,结合INT8存储及Triton查询与反量化融合等技术,大幅提高设备存储资源的利用效率。


多模态与智能体服务适配:围绕视觉处理、思考模式和工具调用完善服务链路,衔接模型能力与应用接口,为智能问答、知识处理、编程辅助和智能体应用提供接入基础。


面向昇腾Atlas 800系列产品以及Atlas 900 A3 SuperPod超节点,相关能力采用共用的核心优化路径,依托vLLM Ascend、CANN与Triton等软件栈提升模型开箱效率,持续优化模型性能,发挥超节点优势,实现硬件算力充分释放。与此同时,持续提供配套推理镜像,集成运行环境与优化能力,降低环境搭建和依赖配置成本,方便用户一键化部署验证、性能评估与应用集成。


面向昇腾950液冷、风冷超节点,SGLang坚持社区upstream能力复用,结合UBS Mem、Triton、Tilelang提升模型开箱效率。依托UBS Mem充分释放昇腾软件栈能力,协同UDIE大页特性带来H2D性能的2倍跃升。 


从算子融合到计算空泡优化,从投机解码到分片存储,昇腾将持续深化模型、框架与硬件的协同,推动DeepSeek V4.1 Flash的推理能力向实际应用转化,为长上下文、多模态与智能体场景提供高效算力支撑。


DeepSeek V4.1 Flash推理部署指导


用户及开发者可访问以下链接获取DeepSeek V4.1 Flash基于昇腾的部署指导,进行体验尝鲜(实际性能与部署方案、参数配置及软硬件环境等因素相关,并将持续优化提升):


vLLM Ascend:

https://docs.vllm.ai/projects/ascend/en/latest/tutorials/models/DeepSeek-V4.1-Flash.html


SGLang:

https://github.com/sgl-project/sglang/pull/38950


注:文中性能比例来自对应算子或局部链路的专项对比测试,实际收益随硬件配置与业务负载变化。



【声明】内容源于网络
0
0
昇腾AI开发者
昇腾社区
内容 993
粉丝 0
昇腾AI开发者 昇腾社区
总阅读10.5k
粉丝0
内容993