大家好,我是萝卜哥~
前天晚上刷推的时候,看到 DeepSeek 官方发了条消息说 V4.1 Flash 正式上线了。说实话当时没太当回事,因为这两个月模型更新太密集了,多到有点麻了。
但后来顺手打开试了几下,直接给我整不会了。
V4.1 Flash 是 DeepSeek 最新发布的模型,9 月 10 号正式上线。
总参数 552B,用的是混合专家架构(MoE),但实际跑的时候输入只激活 8B 参数,输出激活 16B 参数。
你可以理解为
最让我吃惊的是速度。
社区测试下来大概是 每秒 400 到 427 个 token 的输出速度,长文本推理场景下能跑到 420 tokens/s。
这是什么概念呢?
我拿它生成一段两千字的文章,眨两下眼的工夫就刷完了。
上下文窗口直接拉到了 100 万 token,最大输出 38.4 万 token。
也就是说,你可以把一整本书丢进去,它能消化完,还能给你写一篇几万字的分析。
适合场景:长文档总结、代码生成、网页应用原型、批量内容生产、结构化分析,都很适合用 V4.1 Flash 来做第一轮快速产出。
当然,也是降价了。
V4.1 Flash 非高峰时段的价格,输入缓存命中的情况下是 每百万 token 0.003 美元,输出是 每百万 token 0.6 美元。
假如你要处理一个十万字的文档,然后让模型写一万字的总结,用 Claude Opus 5 大概花几块钱,用 V4.1 Flash 可能几分钱就搞定了。
梁圣正式回归。
DeepSeek 官方很自信。
9 月 14 号开始,所有发往 V4 Pro 的 API 请求会自动转到 V4.1 Flash 上处理,计费也按 Flash 的价格来。
这说明 DeepSeek 自己都认为 Flash 已经全面超越了 Pro,没有必要让用户继续为 Pro 付更高的价格了。
这种「自己革自己命」的做法,在商业上是比较少见的。
对开发者来说当然是好消息:
在一些第三方评测里,它跟 GPT-5.6 Sol 和 Claude Opus 5 这种顶级旗舰直接正面对决,而且好几个榜单上赢了。
在 DeepSWE v1.1(软件工程能力评测)上:
•V4.1 Flash:74.2
•Claude Opus 5:74.0
•GPT-5.6 Sol:73.0
Flash 一个「闪电侠」定位的模型,居然在写代码这件事上压了两个旗舰一头。
AutomationBench 上差距更大:
•V4.1 Flash:54.8
•Claude Opus 5:50.3
•GPT-5.6 Sol:45.8
这个测的是模型做自动化任务的能力,说白了就是让 AI 帮你干活的综合水平。
CyberGym 网络安全评测:
•V4.1 Flash:88.1
•GPT-5.6 Sol:84.5
Codeforces 编程竞赛评分达到了 3471,比 V4 Pro 的 3348 又涨了一截。
当然也要说公道话。
在长时间自主任务(Terminal-Bench 3.0 和 4.0)上,Claude Opus 5 还是明显领先的。
在知识密集型测试(HLE)上:
•Claude Opus 5:56.3
•V4.1 Flash:36.8
差距不小。
所以这个模型的强项非常突出,短板也确实明显。
跑分总结
短平快的任务,V4.1 Flash 特别猛;但拉长战线的复杂任务,它还是比不上海外旗舰大模型。
跑分终究是跑分,大家最关心的还是实际用起来到底怎么样。
下面这几个案例我都附上了完整的 Prompt,你可以直接复制到 DeepSeek 里跑,亲眼看看效果。
先来一个简单的。
说实话这个效果有点牛啊。
最厉害的是点一下就能看到对应的地标大厦名称,当然我也不知道准确不,看名字应该差不多,哈哈哈。
再来生成一个上海弄堂的 3D 模型。
这个效果我觉得真的很不错了。
虽然不知道上海的弄堂是不是都是这么红哈,但是如果忽略这个细节,整体很优秀。
最后再来复现一个 Reddit 上非常火的案例
一句话生成一个可以自己随意建造建筑的城市地图。
因为这个感觉要用到 Agent 能力,所以我选择了 WorkBuddy,还是海外版的。
因为现在目前 DeepSeek V4.1 Flash 完全免费,哈哈哈。
直接来看效果,真的很惊艳很好玩。
我们可以一点点按照自己的想法来创建城市,还是非常有成就感的。
这个案例直接把我看傻了。
一个 Prompt 扔进去,它在几分钟之内就给你生成一个能跑的 3D 赛车游戏。
Prompt 直接使用下面这个就好。
跑出来的结果让我挺意外的。
赛道能渲染出来,车能操控,撞到东西还有碰撞反馈。
当然画面精细度跟真正的游戏没法比,但一个 Flash 模型几分钟搞定一个能玩的赛车游戏,这件事本身就很离谱了。
这个 Prompt 覆盖了角色动画、敌人 AI、combo 连击、粒子特效、波次系统、BOSS 战、音效合成这些维度,跑出来的效果应该相当能打。
我体验了一下,感觉挺不错的。
毕竟是纯网页游戏,除了人物出拳有点奇怪之外,其他感觉没毛病。
这种前端交互复杂的项目,以前扔给模型基本都要来回改好几轮。
V4.1 Flash 一把过。
测试结果是:
•列表和卡片的增删改查全部正常
•拖拽排序很流畅
•跨列表拖拽也能跑通
•localStorage 刷新后不丢失
这个项目光是拖拽的交互逻辑就挺复杂的,它能一次性写对,确实有点东西。
这个 Prompt 短,但考验的是模型对空间关系和光影效果的理解。
2 分钟之内就出来了。
组件之间的空间关系建模准确,光影效果也做得有模有样。
说实话,比我预期好不少。
但是这样生成的还是差点意思。
来简单优化一下,带着电脑摄像头和简单编辑器,立刻不一样了。
请忽略我衣衫不整就出镜哈,根本来不及解释。
这个我要重点说一下,因为它体现了 V4.1 Flash 在视觉设计理解上的进步。
跑出来之后我愣了一下。
仪表盘在缓慢转动,雷达在扫描,旁边的状态面板又是另一套刷新频率,底部通信文字在一行一行地打出来。
整个画面看起来真的像那么回事,有一种你坐在驾驶舱里的沉浸感。
关键是这个 Prompt 信息量很大,要同时处理粒子效果、动画节奏差异化、CRT 滤镜好几个维度的东西,它都兼顾到了。
它不只是把元素堆到页面上,而是能理解「不同系统独立运行」这种抽象设计要求,并用不同动画节奏表现出来。
前面几个案例证明了它能写功能,这个案例专门测审美。
Linux DO 上有人说 V4.1 Flash 的「审美水平提升了一大截」,我就想看看到底提升到什么程度了。
这个 Prompt 的难点在于,
画出来只是及格线,画得好看才是真正的实力。
水墨画最讲究的就是留白和浓淡虚实的分寸,这些全是审美判断,代码只是手段。
V4.1 Flash 跑出来的效果让我挺意外的。
•宣纸底色有纹理感
•远山层次确实有浓淡变化
•水面波纹也很克制
•没有做得太花哨
•整体留白意识不错
当然跟真正的水墨画没法比,但作为一个 AI 用代码「画」出来的东西,它的配色分寸感和留白意识已经超出了我对 Flash 级别模型的预期。
GitHub 上有个专门的 DeepSeek v4 Flash HTML 作品集,收录了 100 个纯代码视觉作品,从极光到万花筒到粒子网络都有,有兴趣的可以去翻翻看。
我也分别对比了 K3 和 GLM-5.3 Flash。
K3 效果,感觉有点没有抓到水墨画的神。
GLM-5.3 Flash 的效果,个人感觉比 K3 要好一些,但是整体还是不如 V4.1 Flash。
前端玩够了,来点办公场景的。
我让 V4.1 Flash 直接生成一套完整的 PPT,主题是:
「2026 年 AI 行业趋势分析」
不光要有封面和目录,中间还得插柱状图和饼图,最后来一页总结,整套商务风格。
跑完之后我把生成的代码执行了一下,打开 PPT 的时候有点惊到。
封面页的布局很规整,柱状图和饼图都成功渲染出来了,配色确实统一。
当然细节上还需要手工微调,比如字体间距、图表标签位置这些,但作为一个初稿来说完成度相当高了。
然后可以接着说改成其他风格,比如仙侠风。
感觉人物稍微有点弱,其他还是很靠谱的。
V4.1 Flash 还有一个大升级,就是原生多模态。
以前 DeepSeek 的视觉能力是通过单独的 Vision 模型实现的,等于是拼装的。
现在 V4.1 Flash 从训练阶段就把视觉编码器集成进去了,文字和图像在同一个语义空间里处理。
也就是说,你给它一张图,它理解图片内容和理解文字一样自然。
看图和理解文字这两件事是同时发生的,不需要中间再「翻译」一道。
请用极其细致的观察力描述这张图片。不要泛泛而谈,要像一个侦探一样注意所有细节:物品的材质、磨损程度、光线方向、背景中的环境线索。然后根据这些细节推测一下拍摄者可能是在什么场景下拍的这张照片。
它的描述细致程度和推理能力,会让你觉得有点不可思议。
基本上完全还原了图片的细节,每个角落都照顾到了。
从跑分数据也能看出来,V4.1 Flash 在那种短平快、讲究效率的场景里特别能打。
但遇到需要长时间自主运行的复杂任务,或者知识密度特别高的分析,旗舰模型还是更稳。
V4.1 Flash 最适合快速生成、快速试错、快速搭建原型。它很强,但不是所有任务都应该交给它。真正重要的是:你要知道什么任务适合用它,什么任务应该交给更稳的旗舰模型。
工具再快再强,最后做决策的还是你自己。
选哪个模型,用在哪个场景,这个判断本身就是能力。
先用起来再说。
好不好,试了才知道。
以上就是今天的分享,觉得有帮助,帮请帮一键三连:点赞、转发,再看和留言,你的反馈对我很重要!

