大数跨境

DeepSeek V4.1 Flash限时内测:快了约3倍,更狠的是Agent开始会自己查Bug

DeepSeek V4.1 Flash限时内测:快了约3倍,更狠的是Agent开始会自己查Bug 我的Ai笔记
2026-09-09
5
导读:DeepSeek V4.1 Flash限时内测:速度快约3倍,还开始会自己查Bug了。
点击蓝字,关注我们


banner

这是我的第496篇Ai笔记,本篇2026、累计笔记8484725

彩蛋:结尾扫描二维码,领取《DeepSeek V4.1 Flash 工作实战手册》

icon
引言

DeepSeek 又悄悄塞了个新东西出来。

这次出现的是 DeepSeek V4.1 Flash 限时中间版本,模型名甚至直接写着:

deepseek-v4.1-flash-expires-on-0910

9月10日就到期,正式版目前还没揭盖子。

插图

但第一波测试已经挺有意思了。

最抢眼的当然是速度:V4.1 Flash 多次跑到 300~400+ tok/s,有人测到351、354 tok/s,峰值甚至达到427 tok/s;相比上一版常见100~120 tok/s,差不多直接快了3倍。

不过我觉得,这次真正值得盯的还不只是“快”。

icon
思考

以前提到 Flash 模型,大家很容易想到两个字:

便宜、快。

复杂任务、Coding Agent(编程智能体)、长时间自主执行,通常还是交给更大的模型。

V4.1 Flash 这轮透露出来的变化,是这个边界正在往前推。

插图

因为 Agent 真正干活,时间都耗在一遍遍循环里:写代码、调用工具、看结果、发现问题、修改、再执行。

如果模型能把速度提高到原来的3倍,同时还能看图、判断错误、自己调试,那么压下来的就不只是等待时间。

Agent 干一件完整工作的时间和成本,都可能继续下降。

这个变化,比单纯聊天快一点重要得多。

icon
AI+

01|300~400 tok/s,Agent终于不用慢吞吞干活了

第一波测试里,V4.1 Flash 多次出现300~400+ tok/s。

视觉任务中的一组对比也很直接:V4.1 Flash 跑到 354 tok/s,旧 V4 Flash Vision 是 117 tok/s,同样接近3倍。

插图

这些毕竟是首批测试数据,不代表每一次调用都能稳定跑到350以上。

但3倍这个量级已经足够有体感,尤其是写代码、跑工具这种需要连续执行很多轮的任务。

以前等AI干活还能出去接杯水。

现在这杯水可能都接不完了。

02|112K Token、20轮交互,7分41秒把任务干完

还有一个案例,我觉得比单纯测速更有参考价值。

V4.1 Flash 完整执行了一个高细节体素场景任务,整个过程用了 112K Token、20轮交互、7分41秒,最终做出了包含宝塔、樱花、流水、远山的完整场景,测试记录中的成本只有 0.037美元。

重点其实不在宝塔有多漂亮。

插图

而是20轮任务,它能一直往下干,最后把一个完整结果交出来。

现在看 Agent,我越来越觉得“第一次回答聪不聪明”没那么重要。

能不能连续工作,把事情做完,才是真本事。

03|这个更狠:它开始会自己查Bug了

这轮测试里,我最感兴趣的其实是一个小细节。

模型发现水面效果不对以后,没有傻等着人类告诉它怎么办,而是主动把水面换成醒目的 magenta(洋红色)调试色,再切换俯视角重新读图,继续定位问题。

这就有点程序员查 Bug 的味道了。

插图

Agent 第一次做错并不可怕,真正麻烦的是做错以后还不知道自己错了。

V4.1 Flash 已经开始表现出:

看结果 → 找异常 → 创造调试条件 → 再修正。

另外,同样生成“鹈鹕骑自行车”的 SVG 动画,新版用了 6分39秒、351 tok/s,旧版用了 13分46秒、109 tok/s。新版整体完成度更高,不过旧版反而自己增加了变速效果。

所以还谈不上每一项都碾压。

但“会自己发现问题”这件事,我认为比3倍速度更值得看。

icon
祛魅与吐槽

夸完了,该泼的冷水还是得泼。

插图

第一,它现在还是限时中间版本。

模型9月10日就到期,正式版最终叫什么、能力能保留多少,目前都没有答案。

第二,测速成绩别直接当成官方性能。

不同任务和环境都会影响速度,而且已经有人反馈新版更爱“想”,Token 消耗可能比旧版更猛。

第三,自我调试还远没有到可以完全放手的程度。

鹈鹕案例里,新版整体更好,但旧版某些动态细节反而更有意思,人工检查依然少不了。

先别急着封神。

等正式版出来,再狠狠干一轮才知道它到底有多能打。

icon
三句话

最后,老规矩,三句话总结一下:

1. V4.1 Flash 最直观的升级是速度,第一波测试已经出现接近3倍的提升,而且这种速度开始进入视觉、Coding Agent和复杂长任务。

2. 比速度更重要的是,它开始表现出看结果、发现问题、主动调试再修复的能力,这决定了Flash未来能不能真正成为Agent的主力模型。

3. 现在还是限时中间版本,别急着拿一轮测试下最终结论;真正要等的是正式版能不能把速度、质量和自我纠错一起留下来。

icon
🎁彩蛋福利🎁

模型跑得再快,普通上班族真正关心的还是一句话:

它到底能帮我干什么?

所以这次我专门整理了一份 《DeepSeek V4.1 Flash 工作实战手册》,不讲复杂参数,直接按照日常工作场景来写:写周报、整理会议纪要、做方案、查资料、分析Excel数据、改PPT、写邮件、总结长文档,以及让AI连续完成复杂任务。

插图

每个场景都配了可以直接复制的提示词和使用方法,拿到基本就能开始用。

扫码回复关键词【V41】,我把这份手册发给你。

【声明】内容源于网络
0
0
我的Ai笔记
很干货、有深度、真免费,关注“我的Ai笔记”,每天学Ai技巧! 赋能客户、助力普通人在Ai时代抢占先机。
内容 445
粉丝 1
我的Ai笔记 很干货、有深度、真免费,关注“我的Ai笔记”,每天学Ai技巧! 赋能客户、助力普通人在Ai时代抢占先机。
总阅读25.1k
粉丝1
内容445