大数跨境

练习时长一年半,DeepSeek V4终于交卷!

练习时长一年半,DeepSeek V4终于交卷! MaxMindAI
2026-04-24
1
导读:「DeepSeek 新版本下周更新」的段子,在科技圈传了快一年,今天终于不再只是段子了。

点击上方蓝字关注我们

练习时长一年半,D 老师终于把憋了许久的王炸——DeepSeek V4,端到了全行业面前。

没有喊「吊打 GPT、脚踢 Gemini」的浮夸口号,也没有搞预约排队、限量内测的套路,发布即上线

打开官网对话框,不用任何操作,直接就能免费用上最新模型。

甚至连氪金通道都同步开好了:不管是便宜量大的 V4-Flash,还是冲顶性能的 V4-Pro,开发者 API 直接拉满,交钱就能用。


没吊打 GPT,但在开源圈已经杀穿了

先给各位交个实底,这次的 V4,到底强不强?

一句话总结:没到吊打全球顶级闭源模型的地步,但在开源赛道里,已经是断层领先,甚至能和 GPT、Claude、Gemini 这些闭源顶流正面掰掰手腕。

这次 DeepSeek 一口气放了两个版本,精准覆盖了所有人的需求:

  • V4-Flash:主打便宜、快、不心疼,适合日常唠嗑、写文案、批量出内容。
    总参数 2840 亿,激活参数约 130 亿

  • V4-Pro:主打极致性能,适合写代码、做复杂推理、长文档分析、搞 Agent 开发。
    总参数 1.6 万亿,激活参数约 490 亿

两个版本都用了 MIT 开源协议,你下载下来随便改、随便用,哪怕拿去做商业产品,都不用开源你的二次成果,连授权费都不用掏。

就这一点,已经把开源大模型的天花板,掀到了闭源模型的脸上。

在官方的实测里,V4-Pro 在通用知识、代码能力、数学推理、Agent 调度这些核心场景,基本和 Claude Opus 4.6、GPT-5.4、Gemini 3.1 Pro 打了个平手。

尤其是代码生产力测试里,V4-Pro 的能力明显超过了 Claude Sonnet 4.5,Codeforces 评分高达 3206,直接排到了全球程序员第 23 名。

官方自己也很坦诚,直言和世界最先进的闭源旗舰模型,能力上还有 3 到 6 个月的差距
不尬吹,不玩虚标,这点就比很多同行强太多。


💰 价格还是那个熟悉的屠夫味,涨价了依旧香

熟悉 DeepSeek 的朋友都知道,它家的传统艺能,就是「性能追着顶流跑,价格按着地板打」。

这次哪怕 V4-Pro 的价格比前代涨了 8 倍,我依旧要夸一句:太值了

给大家算笔最直观的账:

模型
百万 token 输出价
DeepSeek V4-Pro
24 元
Claude Sonnet 4.6
约 100 元
GPT-5.5
30 美元(约 210 元)

性能差不多,价格直接打到了 Claude 的 四分之一,GPT 的 八分之一

而主打性价比的 V4-Flash 更夸张,百万 token 输出只要 2 块钱——一瓶矿泉水的价格,能让你处理完一套《三体》三部曲。

最绝的是,DeepSeek 还在文章不起眼的角落里,给所有人画了个饼:

这次的涨价只是暂时的,等过段时间华为的卡到货了,模型的价格还会直接打下来。

好家伙,别人发新模型是给用户看的,DeepSeek 发新模型,一半给用户,一半当着全行业的面,给华为催货

这种“正文不敢写、小字来暗示”的玩法,可谓用心良苦。

而且这次 API 还同时兼容 OpenAI 和 Anthropic 两种格式——以前为 Claude Code 写的工具,可能只改一个环境变量就能切过来用。这种“跨生态兼容”的设计,贴心到不像直男团队。


🔥 真正的王炸:把百万上下文,做成了标配

这次 V4 最让我惊喜的,不是参数和性能,而是它干了件行业里没人敢干的事:

把 100 万 token 的上下文长度,做成了全系列标配。

很多朋友可能不知道,100 万 token 上下文是什么概念?

  • 它能一次性完整读完 《红楼梦》+《三体》三部曲的全部内容,还能精准记住每一个细节。

  • 你可以把一整个中型代码库、上百份合同财报、几十本专业书籍,一次性丢给它,它不会忘事,不会漏信息。

更重要的是,这两个月爆火的各类 Agent 工具,最缺的就是长上下文。

之前就有开发者在论坛分享过翻车经历:他用某款上下文有限的模型处理一份长达数百页的技术文档,模型中途自动压缩记忆,结果把前面定好的关键参数忘得一干二净,最后生成的代码全是 bug,白干一整天。

上下文越长,AI 干活就越不容易翻车。

但为什么之前没人把百万上下文做成标配?因为贵。

传统 Transformer 架构下,对话越长,需要的临时缓存 KV Cache 就越大,推理成本就越高。百万上下文用一次,动辄几十上百块就没了,普通用户根本用不起。

而 DeepSeek 这次,直接把百万上下文的成本,给打穿了地板。

同样带着 100 万 token 上下文干活:

  • V4-Pro:每生成一个 token,计算量只要 V3.2 的 27%,KV 缓存直接砍到了原来的 10%

  • V4-Flash:计算量只有 10%,KV 缓存只剩 7%

别人用百万上下文要花几十块,你用 DeepSeek,一瓶矿泉水的钱就够了

技术原理(不绕弯子版)

能做到这一点,靠的是 DeepSeek 自研的一套 Hybrid Attention 混合注意力架构

大白话解释:

传统模型处理长文本,就像让你把整本《红楼梦》从头背到尾,每回答一个问题都要把全书过一遍。
DeepSeek 的新架构,相当于给文本建立了两层索引——第一层快速定位相关段落,第二层再对这些段落深度精读。
模型不用每次都把百万 token 从头算到尾,而是先圈定范围再重点计算,计算量自然大幅下降,还不会丢三落四。

另外,他们还用上了去年研发的 mHC(流形约束超连接) 来保证长文本稳定性,以及 Muon 优化器 让模型参数收敛更快。

就这一整套组合拳,直接把长上下文的门槛从高端奢侈品拉成了人人都能用的普惠工具


⚠️ 一点遗憾 + 一点贴心设计

当然,这次的 V4 也不是完美的。

最大的遗憾就是,依旧不支持多模态,也就是还是看不懂图片、视频。这块大概率要留给下一代模型了。

不过贴心的是,V4 这次提供了三种思考模式

  • 非思考模式:快速响应,日常对话用

  • 思考模式-高:深度推理,复杂任务用

  • 思考模式-极限:最大化模型边界,建议上下文 ≥384K

复杂 Agent 场景建议直接用极限模式,效果最佳。


玩笑归玩笑,别真把 D 老师当梗王

过去这一年半,DeepSeek 承受的非议,真的不少。

人才流失、国产芯片适配失败、模型延期的传闻一波接一波,「DeepSeek 新版本下周更新」,都快成了科技圈每年愚人节的保留节目。

甚至还有网友 P 图,说 梁文锋这半年沉迷某开放世界游戏,才耽误了 V4 的发布。

但玩笑归玩笑,别真把 D 老师当梗王

DeepSeek 用实力证明,它依旧是那个开源大模型领域当之无愧的 「带头大哥」

去年,DeepSeek R1 的开源,用 560 万美元的训练成本,做出了对标 OpenAI o1 的推理能力,直接给全球大模型开启了「大推理时代」,让无数个人开发者和中小企业,免费用上了顶级的推理 AI 能力。

而今年,DeepSeek V4 的发布,不仅把百万上下文做成了普惠标配,把顶级大模型的价格打穿了地板,更重要的是,它和华为等国产芯片厂商的深度合作,让我们真正看到了 国产 AI 打破海外垄断的决心和实力

它从来不会喊什么「国产之光」的口号,却一次又一次,用极致的技术创新,把原本攥在海外巨头手里的顶级 AI 能力,放到了每一个普通用户、每一个开发者的手里。


📝 最后

有人问,大模型内卷到今天,到底还有什么意义?

DeepSeek 用 V4 给了答案:

内卷的终极意义,从来不是把同行卷死,而是把技术的门槛卷下来,让原本高高在上的黑科技,变成人人都能用、用得起的普惠工具。




  Max Mind

欢迎加入交流群

不定期弹送福利

【声明】内容源于网络
0
0
MaxMindAI
1234
内容 41
粉丝 0
MaxMindAI 1234
总阅读24
粉丝0
内容41