大数跨境

DeepSeek V4-Flash 正式版来了:Agent 跑分逼近 Opus 4.8,百万 Token 输出只要 2 元

DeepSeek V4-Flash 正式版来了:Agent 跑分逼近 Opus 4.8,百万 Token 输出只要 2 元 奔跑的云飞哥
2026-08-01
3
导读:DeepSeek V4-Flash 在部分 Agent 基准进入顶尖梯队,每百万 Token 输出仅 2 元。真正的变化是高水平能力和低价开始同时到位。

行业观察 · Agent 成本

核心趋势并非单一跑分,而是高水平 Agent 能力与极低价格在同一模型上的首次交汇。

2026 年 7 月 31 日,DeepSeek 宣布 V4-Flash 正式版 API 上线公测,重点强化 Agent 能力并公布基准测试数据。同日官方定价页面显示,V4-Flash 输出价格为每百万 tokens 2 元。

此次更新标志着 V4-Flash 正式落地,而 V4-Pro 正式版预计将随后发布。

需明确的是,2 元并非限时促销价,而是正式版挂牌价。当具备多步工具调用及终端代码修改能力的模型,其输出成本降至该水位,此前关于“任务是否值得调用模型”的成本核算逻辑将发生根本性逆转。

01

Agent 基准跻身顶尖梯队,但非总体排名

DeepSeek 官方对比表中,Terminal Bench 2.1 数据最为瞩目:V4-Flash 得分为 82.7,优于 GLM-5.2 的 81.0,并逼近 Opus-4.8 的 85.0。

在 Agent 编程基准单项上,V4-Flash 已超越 GLM-5.2 并接近 Opus 4.8 水平。需注意,各模型测试 Harness 并不完全一致,该数据仅表明 V4-Flash 在部分 Agent 基准上进入第一梯队,不能直接等同于总体能力排名。

同一对比表中另外两项数据同样值得关注:Agents' Last Exam 方面,V4-Flash(25.2)与 Opus-4.8(25.7)、GLM-5.2(23.8)差距微小;DeepSWE 方面,V4-Flash(54.4)虽落后于 Opus-4.8(58.0),但显著优于 GLM-5.2(46.2)。综合来看,V4-Flash 在 Agent 类任务上的高分表现具有稳定性,但尚未完全抹平与旗舰模型的差距。

02

能力与价格首次同步到位

真正的变革在于高水平 Agent 能力与极低价格首次在同一模型上实现统一。过去两年,这两者往往割裂:能处理复杂多步任务的模型成本高昂,而廉价模型在 Agent 循环中容易出错,导致返工成本抵消了节省的费用。因此,业界常规做法仅在关键环节使用高价模型,其余环节依赖人工兜底。

V4-Flash 改变了这一博弈逻辑:问题从“模型能否完成任务”转变为“任务能否高频执行”。前者是能力边界问题,后者则是供给规模问题。在工程实践中,后者才是决定某项能力能否成为日常习惯的关键。

回顾发布节奏,2026 年 4 月 DeepSeek 开源 V4 预览版时即提供 Pro 与 Flash 双型号。截至 7 月 31 日,仅 Flash 版本转正,Pro 版正式版尚未发布。这意味着当前以低价可调用的,是 V4 系列中定位更轻量的档位。Flash 已将价格与 Agent 能力推至新高度,而尚未发布的 V4-Pro 则代表了未来的能力上限,这使得当前的测试分数更具参考价值——它并非用旗舰性能换取性价比标签。

具体定价策略对 Agent 场景极为友好:每百万 tokens,缓存命中输入仅需 0.02 元,未命中输入为 1 元,输出为 2 元。缓存命中与未命中之间高达 50 倍的价差,极大降低了反复读取长上下文场景的成本。

03

AI 大模型价格全行业下行

7 月 30 日,OpenAI 亦调整了价格:Luna 模型输入/输出价格分别从$1/$6降至$0.20/$1.20,降幅达 80%;Terra 模型从$2.50/$15降至$2/$12,降幅 20%。

尽管各家币种与模型定位不同,不宜简单换算倍数对比,但趋势明确:DeepSeek 定价更为激进,且单位智能成本正以超预期的速度被全行业压低。

Claude 等高能力、高成本路线在涉及资金安全、线上生产等容错率极低的场景中依然具有不可替代的价值。然而,将最强、最贵的模型设为所有日常智能任务的默认入口并不理性。对于整理素材、格式检查、批量摘要等不需要天花板级推理的任务,市场更需要的是便宜、稳定且支持高频调用的解决方案。

04

AI 大模型需如水般普及方算到位

通向 AGI 的路径不仅在于推高能力上限,更在于让“足够好”的智能变得廉价、稳定且可大规模调用。

AI 大模型应像水一样成为基础设施。水的价值不在于某一滴特别纯净,而在于打开水龙头即可获取,成本低廉到用户无需为每一次使用进行决策。

DeepSeek 的低价挂牌价本身不直接产生智能,也不意味着 AGI 即刻到来。但它让“随时可用、无需犹豫”在 Agent 级别的能力上首次具备了经济可行性。基础设施的演进规律正是如此:先通过降价消除单次成本顾虑,进而渗透至所有应用场景。

基础设施的演进逻辑:

先便宜到无人再计算单次成本,然后才被应用到所有地方。

【声明】内容源于网络
0
0
奔跑的云飞哥
各类跨境出海行业相关资讯
内容 117
粉丝 0
奔跑的云飞哥 各类跨境出海行业相关资讯
总阅读6.8k
粉丝0
内容117