大数跨境

DeepSeek V4.1 Flash 跑分追平 Opus 5,实测两极分化,开源越做越大,本地部署越来越难

DeepSeek V4.1 Flash 跑分追平 Opus 5,实测两极分化,开源越做越大,本地部署越来越难 至顶AI实验室
2026-09-17
8
导读:分数不重要,能不能替你干活才重要。DeepSeek V4.1 Flash 一周实测汇总,顺便聊聊:开源模型为什么都不管端侧了

  作者 | ZDTL

来源 | 至顶AI实验室


过去一周,AI 圈有一个绕不开的名字, DeepSeek V4.1 Flash。
9月8 日,DeepSeek 先在交流群里放出限时内测,10 号正式上线,总参数552B,MOE模型,输入激活8B,输出16B,跑得快、成本低,完全开源。
价格依然很诱人,非高峰时段,每百万token 输入1 块钱、输出4 块,缓存命中的输入只要2 分钱,高峰时段翻一倍。
这种价格基本表明Flash就是一个走量的模型,但却被官方摆到了接班4.0 Pro 的位置上,这或许源自其不错的成绩。
在软件工程测试DeepSWE 上,V4.1 Flash 拿了74.2,相比的Claude Opus 5 是74.0,GPT-5.6 Sol 是73.0,V4.1 Flash又一次排在了两家顶级闭源模型的前面。
不过在专家级学科知识的Humanity's Last Exam的评测上,它只有36.8,比Claude Opus5少了近20 分。
分数一出来,国内外的博主几乎同时开测。
国内被打动的是价格和速度,我印象中有篇实测,标题是"降价后熟悉的梁圣又回来了",当年DeepSeek 靠价格掀桌子的那股劲,又让人想起来了。
内测刚开放就有大量自媒体晒对比,同一批任务,和之前的视觉实验版相比,生成SVG 代码快了6 倍,长文档检索快了5 倍多,每秒三四百token,字几乎是往外喷的。
B 站上"吊打自家Pro"这类标题,一搜一大把。
冷静一点的声音也有,一位UP 主做完六项能力测试,只留了一句"好像有点不一样?"。小红书上一篇实测的结论:道阻且长。
国外博主测得更细,意见也更分裂。
WorldofAI在内测期间就发了完整视频,编程、3D 模拟、网页小游戏、智能体任务、看图,挨个过了一遍,给的评价是又快又省又好用。
可MindStudio 汇总的几项实测,画风完全不一样。
让它写代码画一幅图,59 秒搞定,花了不到2 分钱,效率确实没话说,画出来的东西却明显比同台几个强模型差。让它做个魔方模拟,打开一看有模有样,能转能动,可一打乱就露了馅,色块会莫名其妙地变颜色;点"还原",它根本没去算怎么解,只是把打乱的步骤倒着放一遍,来回几次,魔方彻底乱套。再让它用画图软件临摹一张肖像,能认出画的是谁,但整张画是平的,没有强模型那种一层层叠上去的笔触。
MindStudio对它的评价是,花架子,看着像样,逻辑混乱。
独立评测机构给出的数字,和这个感觉差不多。
Artificial Analysis的综合智能指数给了它40 分,在同体量的开源模型里已经算很高了,输出速度实测每秒214 token,也很突出。可就在同一张榜上,智谱的GLM-5.3-Flash 拿了42 分,压了它一头,跟最前沿的那几个闭源模型比,差距就更大了。Kingy AI 还做过一个小范围的对照,让它和Qwen3.8-27B 做同一批编程、看图和工具调用任务,Qwen 8 次全过,DeepSeek 过了7 次,胜在花钱少。
回过头再看,夸它的人盯着速度和价格,挑毛病的人盯着活到底干没干对,两拨人各说各的。
同样Terminal-Bench,V4.1 Flash 在2.1 版上是90.6,换成更难的3.0 版就只剩30。同一个模型,测试版本一换,分数差出三倍,一个数字讲出两种故事。
编程跑分标准,大多是写出来的代码能不能通过一套现成的测试,可平时我们交给模型的活,很多压根没有标准答案,我们做一个真能用的小工具,理清一段绕来绕去的逻辑,要把一件事从头办到尾。
魔方模拟就是现成的例子,界面好看,分数也高,偏偏不能用。
我个人始终认为,能干活的模型才是好模型,跑分最高的未必是。
V4.1 Flash确实快和便宜,批量处理文本、写草稿、搭个简单网页、跑自动化流程,这种够用就行的任务交给它,很可能是眼下最划算的选择。
要是打算让它扛那些逻辑要严丝合缝、长流程的任务,先别看排行榜,拿自己手头的真实任务跑一遍再说。
开源了,本地跑得动吗?
前面提到的Kingy AI 那次对照,他有一个观点我很认同,要论在普通电脑上跑本地模型,Qwen 更现实。
这是本地AI应用者最关心的事情,开源了,我能不能直接在本地跑?
上一代Flash 在这件事上其实做的还可以,V4 Flash 总参数284B,社区压缩之后一百来个G,量化后,192G内存的机器就装得下,单台 AI Max+ 495的设备每秒也能出十几个token,整体看还不算太离谱。
到了 V4.1,参数翻了将近一倍,官方放出来的原版权重就有480G 左右,想跑起来,基本得上一台8 卡服务器。
Youtube上有人拿单台DGX Spark 试过,128G 内存装不下,就把大部分权重留在固态硬盘上,用到哪块读哪块。模型跑起来了,可每秒还出不了1 个token,问一句话,等第一个字蹦出来要74 秒,能处理的上下文也只开到2048 个token。
能跑吗,能,能用吗,不能。
目前本地部署最顺利的,是Diffbot 在Hugging Face 上放出的一套方案:把权重狠狠压缩到2 比特左右,塞进两张96G 显存的RTX PRO 6000,单路生成每秒113 个token,4 路同时跑,加起来接近280。
他们拿真实的编程智能体任务连续跑了40 分钟,处理了184 次请求,模型压得太狠,关掉思考模式后,简单任务看不出损失,复杂任务完全拉垮。
其实我们知道,本地AI 最看重的不是算力,是显存,目前看,下周开始交付的512GB 版Mac Studio,量化之后或许装得下,我们等着看实测。
所以想把V4.1 Flash 搬回家的,先掂量掂量手里的显存,别被"开源"两个字晃了眼,用API 调它,一百万token 才几块钱;自己部署,门槛是两张专业卡起,起码20万+。
其实不止DeepSeek一家,我们把今年国产开源模型放到一起,就会发现,现在的开源模型越做越大,端侧似乎被遗忘了。
DeepSeek的Flash,从上一代的284B 涨到这一代的552B;智谱之前的GLM-4.7-Flash,还常被列进适合消费级显卡的推荐名单,到了GLM-5.3-Flash,总参数已经是320B。MiniMax M3 开源出来的权重约428B,Kimi K3 比通义2.4T 的旗舰还要大。
Flash原本的意思是快、轻、便宜,现在只剩便宜。
可日常办公真正用得上的本地模型,恰恰是20B 到100B 这一档,写周报、改文档、总结会议纪要、查资料、写个小脚本,这些活用不着几百B 的模型,要的是在自己电脑上跑得起来,数据不出门。
按现在的硬件,32G 内存的机器能跑三十多B 的量化版,比如Qwen3.8-27B 压缩后只有20G 左右,今年厂商们卖得最卖力的AI PC、统一内存小主机和桌面工作站,对应的正是这个区间。
而国外厂商在这一档并没有缺席,Google 的Gemma 4 有26B 的版本,OpenAI 的gpt-oss 有20B 和120B 两个尺寸,英伟达也有自己的Nemotron 系列。
国产头部厂商里,还在认真做这一档的,几乎只阿里通义。Qwen3.8 这一代,旗舰做到了2.4T,同时开源了一个27B,用的还是最宽松的Apache 协议,而且还足够聪明。
为什么大家都往大了做,原因我觉得也不难猜。
模型大才冲得上排行榜,才撑得起API 生意,发布会上报出一个几百B、上万亿的数字,声势也足,一个 30B 以内的小模型,很难上热搜。
另外,模型厂商也要赚钱,能在端侧用模型的偏C端用户,从来就不是这几个模型厂商的主力付费用户,端侧一旦跑起来,还会影响自家的API生意。
大参数的模型开源,主要针对大型国央企等数据不能上云的公司,他们大多除了部署模型,还会为定制化付费。
所以,开源大参数模型,名声有了,钱也赚了,何乐而不为。
至于端侧,谁让你穷呢….
最后,由衷的致敬阿里通义实验室!



END
本文来自至顶AI实验室,一个专注于对AI计算机、工作站及各类AI相关硬件设备,开展基于真实使用场景评测的研究机构。





【声明】内容源于网络
0
0
至顶AI实验室
一个专注于探索生成式AI前沿技术及其应用的实验室。
内容 51
粉丝 0
至顶AI实验室 一个专注于探索生成式AI前沿技术及其应用的实验室。
总阅读797
粉丝0
内容51