大数跨境

ZPedia|实测DeepSeek V4.1 Flash:CED 架构压低Agent成本,多模态精度仍是短板

ZPedia|实测DeepSeek V4.1 Flash:CED 架构压低Agent成本,多模态精度仍是短板 Z Finance
2026-09-10
1
导读:552B开源+Harness一体化,DeepSeek的野心不只是一个便宜的API
导语

9 月 10 日,DeepSeek V4.1 Flash 正式开源。该 552B 新模型引入全新的CED(Causal Encoder-Decoder)架构:Prefill 阶段每 token 仅激活 8B 参数,Decode 阶段激活 16B,KV Cache 大幅缩减,显著降低了 Agent 任务的部署成本。

此前内测版本已展现原生多模态、推理提速及空间感知升级等特性。本次测评聚焦真实任务落地能力:从网页还原、数据看板、规则模拟到 3D 交互及视频生成,验证多模态理解与执行效率的同步兑现情况。

组织层面信号明确:DeepSeek 同期 release 约 150 个工程岗位,全数投向服务端与 Agent 弹性计算,无研究岗;Harness 同步更新至 v0.1.5 以适配迭代。模型与工具链的双重加码,标志着竞争重心正转向交付链路。

原生多模态升级:推理提速,空间感知超预期

继 8 月推出支持 API 图片输入的 V4-Flash-Vision-Exp 后,V4.1 Flash 实现了原生多模态支持,进一步强化视觉与空间感知能力。

官方数据显示,V4.1 Flash 在四项 Agent 基准测试中全面领先 Kimi-K3:Terminal-Bench 3.0(30.0 vs 17.7)、DeepSWE v1.1(74.2 vs 67.5)、CyberGym(88.1 vs 80.0)及 Automation-Bench(54.8 vs 46.7)。尽管与顶尖闭源模型仍有差距,但其在视觉推理、专业图表解读及“看图自检”流程上已实现闭环。

在视频重建 3D 房间任务中,对比 Astra,DeepSeek V4.1 Flash 虽存在细节缺失、空间排布不够精准及穿模等遗留问题,且因截图信息不全导致部分丢失,但整体表现已大幅超出预期。

DeepSeek V4.1 Flash 空间感知效果(图源:测试用户 Subly7)

Astra 空间感知效果(图源:测试用户 Subly7)

未来竞争将延伸至 Blender、Web 3D、工业 CAD 及渲染自检等三维软件实操领域。速度方面,社区实测平均解码速度约为 350 tokens/s。

NVIDIA 开发者论坛转帖:平均解码速度约为 350 tokens/s

推理速度的提升源于Prefill、长上下文 Decode、投机解码及底层执行全链路的开销压缩。

首先,引入Causal Encoder-Decoder(CED)架构,将 40 层网络拆分为 20 层编码器与 20 层解码器。处理长 Prompt 时,输入 Token 仅需经过前半部分 Encoder,Decoder 所需的 Global KV 由 Encoder 末层隐藏状态逐层投影生成,避免了全量 Token 重复计算。

配合Decoder SWA Bounded Replay技术,长序列 Prefill 复杂度从 O(NL) 降至近似 O(NL/2),输入侧计算量减半。

生成阶段采用Compressed Sparse Attention 2(CSA2)降低长上下文 KV 及索引成本:注意力层分为 Full、Reindex 和 Reuse 三种模式。仅 Full 层完整生成 Global KV 并执行 Top-K 检索;Reindex 层复用前层 Main KV 并重选 Top-K;Reuse 层则直接复用结果,省去索引计算。

此外,Hierarchical Sparse Indexer使首层 Indexer 筛选出候选池,后续层仅在固定集合内重选 Top-K,确保百万 Token 级别下 indexing 成本不随长度线性增长。

为提升出词速度,模型集成DSpark Speculative Decoding:轻量 Drafter(3 个 Transformer Block)并行预测 5 个候选位置,结合 Confidence Head 估计接受概率,动态选择验证长度,最大化主模型验证吞吐。

综上,V4.1 Flash 通过CED 减半 Prefill 计算、CSA2 控制长上下文 Decode 成本、DSpark 提升生成吞吐,实现了三项关键加速。

底层优化方面,结合Single-Pass mHCMega-mHC Kernel,打破数据依赖以融合残差更新等操作,Activation Memory Traffic 减半;Main KV Cache 压缩至FP4,减少 HBM 与 SSD 搬运量;通过 Kernel Fusion 将 CSA2 Reuse 层压缩至 Prefill 约 15 个 Kernel、Decode 约 11 个 Kernel,进一步降低延迟并提升吞吐量。

扩招 150 名工程师,模型深度集成 Harness

9 月 8 日内测开启同日,DeepSeek 发布约 150 个工程师招聘需求,仅设服务端开发与 Agent 弹性计算两类,面向 2-10 年经验资深后端,无 AI 研究岗。

此次招聘重点明确:服务端覆盖研究平台、Agent 框架、API 及数据工程;弹性计算对应 DSec(DeepSeek Elastic Compute),系统栈改造贯穿操作系统至应用层调度。团队负责人崔添翼指出,数据量、训练任务及用户请求激增,亟需升级维护原有后端甚至重写模块。

此举释放清晰信号:模型侧聚焦多模态与效率,组织侧保障请求稳定与环境调度。研究岗的缺席表明,当前瓶颈已从单纯模型研发转向工程化落地与 GPU 效率提升。

9 月 10 日,DeepSeek Harness 更新至 v0.1.5,与 V4.1 Flash 深度绑定。新版支持标准模式、程序化工具调用及极简模式下的专项优化,修改系统提示词可保留 KV Cache。功能上支持父子 Agent 双向通信、消息排队与中断、Web 端文件上传预览,并开放实验性 Agent Teams 插件。

这表明 DeepSeek 正交付“模型+Harness"的整体解决方案,150 个工程岗位的落点正是强化这一层交付能力。

五维评测:初版生成快,收尾优化慢

测评沿用 ZPedia 标准:模型独立完成代码编写、运行及自检,记录卡点、返工轮次及人工介入情况。五道考题涵盖网页还原、数据处理、规则模拟、3D 交互及视频生成。

Case 1:NASA 网页截图还原

任务要求基于 NASA「Webb Images」截图生成单文件 HTML。模型准确捕捉了双层导航、标题介绍、分类入口及底部星系图等核心结构,配色与分区还原度高。

主要差距在于比例控制:字号偏小、内容区域过窄、留白过多且底部图片高度异常。虽元素齐全,但整体布局显得紧凑粗糙,缺乏原图的舒展感。

Case 2:运营数据驾驶舱

基于 7 天 4 模型数据构建离线驾驶舱。核心指标(请求量、成功率、成本等)读数准确,成本模拟验算无误。页面包含总览、图表、异常事件及明细,业务信息完整。

驾驶舱总览:五项核心指标及四类图表

驾驶舱下半屏:异常事件与成本模拟器

体验短板在于信息密度:明细表字体过密,部分图例在深色背景下辨识度低,追踪具体数据较为困难。

Case 3:12 人规则撤离沙盘

模拟建筑疏散场景,实时计算寻路、烟雾及排队。模型清晰呈现了人员移动、烟雾扩散及统计更新过程。最终 11 人撤离,1 人受困,逻辑符合预期。

疏散沙盘运行展示

亮点在于对规则变化的解释能力:左侧展示空间关系,右侧呈现统计数据,辅以事件日志,清晰说明了关门对疏散结果的影响。

Case 4:3D 可玩魔方

利用原生 Web 技术制作支持打乱、转动及复原的 3D 魔方。操作区布局合理,中央展示主体,两侧分列控制与状态信息,历史记录清晰。

魔方训练器初始界面

视觉上色块反差鲜明,但初始视角偏低,顶面几乎不可见,三维结构展示不够充分,需调整视角以获得更直观的空间感。

Case 5:15 秒异常数据复盘短片

依据数据生成 15 秒 1080p MP4 短片。视频完整呈现品牌片头、两次异常、恢复数据及片尾,数字变化方向准确,颜色区分清晰。

生成的 15 秒异常复盘短片

瑕疵集中在恢复页:图例与横轴小字出现方框乱码,影响了画面的精致度,但主体信息传达无误。

综合来看,模型在功能实现与数据准确性上表现优异,差距主要集中在比例、密度、视角及字体等收尾细节,需人工逐项校对。

耗时分布印证了这一判断:初版生成仅需约 15 分钟,但自检与返工耗时超过 45 分钟。生成环节占比极小,大部分时间耗费在反复修正上。模型适合快速验证想法,但在成品交付的推理效率上仍有提升空间。

V4.1 Flash 通过 CED 架构降低成本,凭借原生多模态拓展任务边界,依托 Harness 补齐工具链,形成了一套完整的组合方案。下一步的关键,在于能否将收尾工作纳入自检闭环,真正将成本优势转化为稳定的交付能力。

来源:https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf

【声明】内容源于网络
0
0
Z Finance
我们相信认知能够跨越阶层,致力于为年轻人提供高质量的科技和财经内容。
内容 906
粉丝 0
Z Finance 我们相信认知能够跨越阶层,致力于为年轻人提供高质量的科技和财经内容。
总阅读104.6k
粉丝0
内容906