大数跨境

DeepSeek V4.1 Flash上线:图片输入、百万上下文,API同步开放

DeepSeek V4.1 Flash上线:图片输入、百万上下文,API同步开放 AIGC开放社区
2026-09-11
8
导读:5520亿骨干参数,单Token最多激活160亿

9 月 10 日,DeepSeek 正式发布 V4.1 Flash 模型,同步开放 API 接口及模型权重。新模型支持文本与图片多模态输入,上下文窗口长达 100 万 Token,核心优化了长场景下的 KV Cache 占用及 Agent 任务效率。此次升级并非单纯堆砌参数,而是致力于在复杂任务中实现“低存储、低算力、长续航”的推理目标。

关键参数概览

  • 模型名称:DeepSeek V4.1 Flash
  • 发布时间2026 年 9 月 10 日
  • 模型类型:多模态 MoE(混合专家)模型
  • 骨干参数:5520 亿
  • 激活参数:输入阶段约 80 亿,解码阶段约 160 亿
  • 输入模态:文本、图片
  • 上下文长度最高 100 万 Token
  • 开源协议:MIT
  • API 标识:deepseek-flash

需注意的是,"5520 亿参数”指模型卡标明的骨干参数。此外,模型还包含约 1960 亿参数的 Engram 条件记忆模块。

DeepSeek-V4.1-Flash 与主流前沿模型在 Agentic Benchmark 上的性能对比

架构革新:输入输出分离计算

V4.1 Flash 采用因果编码器—解码器(Causal Encoder-Decoder)架构,将输入编码与输出生成阶段分离。官方数据显示:

  • 输入预填充阶段:每 Token 激活约 80 亿参数;
  • 输出解码阶段:每 Token 激活约 160 亿参数;
  • 整体结构:由 40 层 Transformer 组成,编码器与解码器各占 20 层。

该设计专为 Agent 任务优化。在长对话、代码操作及多轮工具调用场景中,输入内容往往远超输出长度。通过降低输入阶段的激活参数量,有效缓解了长上下文任务的计算压力。但需注意,受限于完整权重、视觉模块及推理框架,本地部署仍需较高的显存与存储支持。

核心技术:KV Cache 深度压缩

KV Cache 是大模型处理长上下文的关键缓存结构。针对连续对话及多轮工具调用中的高缓存占用问题,V4.1 Flash 引入了多项压缩技术,包括 SWA Bounded Replay、Compressed Sparse Attention 2、分层稀疏索引及 FP4 格式主 KV 缓存。

据模型卡披露,V4.1 Flash 的全局 KV Cache 约为每 Token 890 字节。相较于 V4 Flash 减少至四分之一,较初代 V1 模型更是大幅降低至四百三十七分之一,显著降低了显存成本。

多模态能力:原生支持图文输入

V4.1 Flash 是一款原生多模态模型,内置 DeepSeek-ViT 视觉编码器与两层 MLP 投影器,可将图片转换为视觉特征并与文本协同处理。其应用场景涵盖:

  • 图片问答与图表分析
  • 文档理解与视觉辅助编程
  • 图文混合的 Agent 任务

目前模型卡明确支持“图片 + 文本”输入,暂未提及视频输入能力。

超长上下文:1M Token 实战能力

模型已正式支持最高 100 万 Token 上下文。训练策略上,先通过短序列进行稀疏注意力训练,再扩展至 1M Token。官方推理示例也已将该窗口设为默认值。不过,1M 为理论上限,实际运行速度仍受限于硬件显存、并行策略及服务商配置。

基准测试:Agent 任务表现突出

在多项权威评测中,V4.1 Flash 展现了强劲性能:

  • DeepSWE v1.1:74.2
  • Terminal-Bench 2.1:90.6
  • MMMU-Pro:56.5
  • DocVQA:95.6
  • GPQA Diamond:90.9
  • HumanEval:79.4

DeepSeek-V4.1-Flash 与主流前沿模型在 Agentic Benchmark 上的性能对比

API 服务与部署说明

API 上线与迁移:新模型已通过 deepseek-flash 接入 API。原有 deepseek-v4-flash 及相关视觉实验版将逐步路由至 V4.1 Flash 以兼容调用。定价策略保留峰谷机制,闲时价格为高峰时段的一半。V4 Pro 请求将于 9 月 14 日起暂时路由至 V4.1 Flash,直至 V4.1 Pro 发布。

开源与部署门槛:模型权重已在 Hugging Face 开放(MIT 协议),提供 BF16、FP8 等格式。但“开源”不等于“轻量”,百万级上下文与多模态特性对硬件要求极高。DeepSeek 指出,大规模部署需约 2000 张 GPU 集群,此为服务端场景需求,非个人运行最低门槛。对于普通开发者,调用 API 或等待消费级显卡量化版本更为现实。

行业意义:从参数竞赛转向效率基建

V4.1 Flash 的发布标志着大模型竞争维度的转变。行业焦点正从单纯的参数规模与跑分,转向真实场景下的持续运行能力、工具调用效率及推理成本控制。通过架构创新解决长上下文与 Agent 任务的资源瓶颈,DeepSeek 正推动大模型向更高效的基础设施演进。其实战效果尚待更多独立测试验证,但其技术路径已为行业提供了重要参考。

【声明】内容源于网络
0
0
AIGC开放社区
1234
内容 1951
粉丝 0
AIGC开放社区 1234
总阅读54.3k
粉丝0
内容2.0k