大数跨境

Gemini 3.8 Flash 发布:价格一分没涨,谷歌让便宜模型开始“加班”了

Gemini 3.8 Flash 发布:价格一分没涨,谷歌让便宜模型开始“加班”了 AI大模型智能体前沿
2026-09-03
2
导读:9 月 2 日谷歌连发 Gemini 3.8 Flash 与网络安全特化版 Cyber,看懂成绩、机制、价格和开放范围。

导读9 月 2 日谷歌发布 Gemini 3.8 Flash 与网络安全特化版 Cyber,这是六周内第三款 Flash,单价不涨、直接 GA。长程软件工程测试 DeepSWE v1.1 追到 73.7%,距 Claude Opus 5 仅 0.3 个百分点;但谷歌在官方博客里写明,这代模型靠“更努力地工作”——更多推理步骤、更频繁地迭代调用工具——换性能,高负载下 token 消耗会上涨,而考查陌生任务的 Terminal-bench 4.0 只拿到 19.1%。本文拆清它的成绩、机制、成本账和能力边界。

六周三款 Flash,这次谷歌连 Preview 都不要了

美国当地时间 9 月 2 日,谷歌正式推出 Gemini 3.8 系列,包含两个版本:通用的 Gemini 3.8 Flash,以及专攻网络安全的 Gemini 3.8 Flash Cyber。算上 3.6 和 3.7,这是谷歌六周内发布的第三款 Flash。

节奏快之外,还有两个细节值得注意。一是这次没有 Preview 后缀,API 里的稳定模型名就是 gemini-3.8-flash,发布即 GA;二是价格维持 3.7 Flash 的首发促销价:输入每百万 token 0.75 美元,输出 3.75 美元。

但价格页里藏着一行小字:这个促销价 2026 年 12 月 31 日到期,2027 年 1 月 1 日起输入涨到 1.50 美元、输出涨到 7.50 美元,直接翻倍。规格方面,3.8 Flash 支持 100 万 token 上下文、最大 64K 输出,接受文本、图片、音频、视频和 PDF 输入,函数调用、代码执行、搜索均已可用,电脑操作还处于 Preview。

图片来源:Google 官方博客

谷歌给这代模型的定位很明确:不是更聪明的旗舰,而是“最智能的干活模型(workhorse model)”。

这也不只是谷歌一家的转向。过去一年,前沿模型在传统考试类基准上的差距越拉越近,“谁更聪明”越来越问不出区分度;各家发布会的主角,换成了“能不能把活从头干完”的长程任务测试。旗舰也在往这个方向走,只是 Flash 把这件事说得最直白——官方给它的定位原话就是 workhorse,干活的马。

理解这句话,得先看它交出的成绩单。

长程 Coding,Flash 摸到了旗舰的门槛

这次最硬的一个数字来自 DeepSWE v1.1。这个基准测的是模型能不能在陌生代码库里持续工作,把复杂工程问题从头做到尾——长程软件工程,正是 Coding Agent 最核心的场景。

3.8 Flash 拿到 73.7%,上一代 3.7 Flash 是 65.3%。作为参照,Claude Opus 5 是 74.0%,GPT-5.6 Sol 是 72.7%。也就是说,Flash 和旗舰的差距只剩 0.3 个百分点,而单价差着一个数量级:Opus 5 的 API 定价是输入 5 美元、输出 25 美元每百万 token。

图片说明:横轴为单任务平均成本(越靠右越便宜),纵轴为准确率;数据源为 Datacurve AI。图片来源:Google 官方博客

其他几项关键成绩:Terminal-bench 2.1(智能体终端编码)89.4%,微超 Opus 5 的 89.1%;金融分析任务 Vals Finance Agent v2 拿到 61.4%,反超 Opus 5 的 58.6%;法律工作流 Harvey 测试 10.0%,同样是参测模型里最高(该测试口径为 all pass rate,绝对值普遍偏低);跨学科专家推理 HLE-Verified 54.9%,与 Opus 5 的 54.4% 基本持平。据第三方平台 Artificial Analysis 的统计(经媒体转述),它的输出速度约为 305 tokens/s,单任务成本约 0.58 美元。

一款走量定位的便宜模型,在旗舰传统强项里打到这个位置,是这次发布真正的新闻点。但谷歌自己在博客里把话挑明了:这个成绩不是白来的。

谷歌的解法:让模型“更努力地工作”

官方博客原文有一句很坦率的话:性能提升源于一个核心设计选择——3.8 Flash works harder。面对复杂任务,它会执行额外的推理步骤,反复迭代调用工具;在更高的 effort 档位下,可能消耗更多 token。谷歌同时给了退路:在意成本的开发者可以调低 effort,或者继续使用仍完全支持的 3.7 Flash。

翻译成工程语言:这代模型把“想不通就多试几遍”做成了默认策略。写代码、运行、报错、读报错、修改、再运行——这个 agentic loop(智能体循环)本来就是 Agent 干活的方式,而 Flash 的单价和速度让高频循环在经济上成立:同样的任务,它循环十次的成本,可能仍低于旗舰模型深思一次。

行业里三条路线的分化因此更清楚了:Anthropic 押知识可靠与稳定输出,OpenAI 押深度推理,谷歌则把极低成本的高速循环做到极致。这不是“笨办法”三个字能否定的——在长程编码这类任务天然需要反复试错的场景里,循环次数本身就是资源。

谷歌官方演示的四个 Demo——3D 巫师游戏、地形剖面工具、硬件拆解可视化,以及最有画面的 DOS 版谷歌地图——都是这个思路的注脚。最后一个:在 Agent 开发环境 Antigravity 里输入一条目标指令,模型自己搭项目、调真实地图 API、写测试,最终交出可检索地点、规划路线、甚至能看 360 度街景的成品,27 项自动化测试全部通过。

图片说明:录屏截取自官方演示,DOS 地图中路线规划为伦敦威斯敏斯特至国王十字,3.9 英里约 26 分钟;由 Google 官方发布视频转换。图片来源:Google 官方博客

到这里为止,循环说的都是模型在跑任务时多卖力气。姚顺宇那句“RSI 一大步”指的是另一层:循环也在参与造模型。

他在 X 上写道:对模型而言这只是一小步,但对 RSI 来说是一次巨大飞跃。RSI 是 Recursive Self-Improvement 的缩写,即递归自我改进——让模型参与评估和改进自身的闭环。谷歌博客里有一句对应的官方表述:两款模型都由长期运行的 agentic loop 加速,这些循环被设计用来递归地评估和改进底层模型;编码能力的增益,部分还来自网络安全这类高要求领域的训练——Cyber 版在最难的攻防任务上练出的东西,反哺了两个版本共用的底座。

换句话说,agent 对这代 Flash 有两重身份:既是它干活的方式,也是它被改进的方式。前一重有 DeepSWE 73.7% 这样的成绩单;后一重谷歌只给了定性描述,没有配套技术报告,循环具体贡献了多少增益、反馈如何进入训练,目前还是黑箱。

同一张官方总表,也把边界写得很清楚

官方总表如果只看蓝底高亮的格子,全是好消息。但把整张表读完,故事会复杂很多。

最刺眼的是 Terminal-bench 的新旧版本对比。2.1 版上,3.8 Flash 是 89.4%,微超 Opus 5;到了 8 月底新出的 4.0 版,它只有 19.1%,而 Opus 5 是 51.8%,GPT-5.6 Sol 是 37.3%。

图片说明:上图为 Terminal-bench 2.1(智能体终端编码),下图为 4.0(通用智能体能力);数据来自谷歌官方总表。图片来源:Google 官方博客

同一个模型,两代考试差出 70 个百分点,合理的解释是:2.1 这类发布较早的基准,题型和解法已被充分吸收进训练与工具链;4.0 考的是陌生的、未经打磨的真实世界任务,循环堆次数的收益大幅下降,底层智能的差距重新露出来。电脑操作基准 OSWorld-2.0 也是类似格局:3.8 Flash 59.0%,Opus 5 为 75.4%;知识工作类的 GDPVal-AA v2,它的 Elo 是 1545,Opus 5 是 1824。

然后是那笔成本账。单价没涨,但“更努力工作”意味着高 effort 档位下单任务 token 消耗可能明显高于 3.7 Flash——任务总成本取决于完成率和循环次数,不是单价一个数字。再加上促销价 2027 年翻倍,把大批量任务长期压在 Flash 上的成本模型,需要按总 token 重新算一遍。

外界的冷水也来得很快。发布同期 Meta 推出 Muse Spark 1.3,其首席 AI 官公开嘲讽 Gemini 在智能指数上落后;社区也有“刷榜”的质疑。需要注明的是,Muse Spark 1.3 目前还是受限预览,而 Terminal-bench 4.0 的落差是谷歌自己总表里的数字,比任何口水都有说服力。

所以迁移建议其实很清楚:长程编码、批量 Agent 流水线这类“循环多、容错高、成本敏感”的任务,值得立刻在自己的代码库里试 3.8 Flash;陌生环境泛化、电脑操作、知识密集型分析,旗舰仍然更稳;跑大批量固定流程时,盯紧任务总 token,而不是只看单价。

还有一个“只防不攻”的 Cyber 版

同场发布的 Gemini 3.8 Flash Cyber 是另一个故事。按官方说法,它与普通版由同一套底座智能驱动、共享核心增益,在此之上做网络安全方向的特化训练,并放宽了一部分网络安全类限制;训练优先级明确偏向防御——补丁修复,而不是漏洞利用。

两者共享到什么程度、又在哪里分开,官方留了模糊空间。特化训练是官方明说的,而只要训练,权重就必然有差异——CyberGym 考的是模型自身的挖洞能力,若两个版本的区别只是系统提示和安全过滤器的松严,“解锁”不出本来不存在的能力。谷歌没有公开的是分叉的深度和形态:最轻的一端是 LoRA 一类挂在冻结底座上的轻量适配器,最重的一端是从共享底座晚期分叉、各自跑完领域强化与安全对齐的两套完整权重;而“放宽限制”那部分,大概率还叠加了运行时的安全策略调整——训练决定模型“会不会”,策略层决定“让不让答”,两层通常同时存在,各占多少同样没有交代。

成绩相当抢眼。漏洞发现基准 CyberGym(C/C++ 代码库)上,它拿到 86.2%,超过前代 3.5 Flash Cyber 的 77.5%,也高于 GPT-5.6 Sol 的 83.6%。在谷歌内部一套覆盖 20 种编程语言的代码库测试中,漏洞发现成功率超过 70%(该数字为谷歌内部基准,无外部独立复现)。补丁修复基准 CWE-Bench 上,它的 pass@1 为 47.2%,领先前沿模型为 47.8%,几乎打平,单次成本却低得多。

图片来源:Google 官方博客

实战案例更能说明它的定位:Chrome 安全团队用它生成漏洞补丁,正确补丁数量是最强商业模型的 2.6 倍;安全公司 Wiz 的内部渗透测试中,漏洞发现召回率提升 7.5 到 9.7 个百分点,成本只有其他前沿模型的 2.3 到 5.2 分之一;谷歌云漏洞研究团队用它在不到两小时内挖出一个关键基础漏洞,这类漏洞以往通常需要专家数月研究。

但普通开发者拿不到它。Cyber 版只通过新的 Fairwind 计划,向可信政府机构、关键基础设施运营方和软件维护者开放申请。API 里那个 gemini-3.8-flash 是普通版,不是 Cyber 端点。谷歌同时强调,3.8 系列内置化学、生物、放射、核风险与网络攻击滥用的防护,第三方 Gray Swan 测试显示其抗提示词注入能力也有明显提升。

写在最后:真正的考试在下一张卷子

3.8 Flash 已经全量可用:开发者可以在 Gemini API、AI Studio、Android Studio 和 Antigravity 中调用,企业用户走 Gemini Enterprise,AI Pro/Ultra 订阅用户能在 Gemini App、搜索 AI Mode 和 Google Sheets 里直接用。

这代发布最值得记住的,不是某个单项分数,而是竞争尺度的变化:Flash 与旗舰的问题,已经从“便宜模型能不能做”变成了“在什么任务上该用谁”。谷歌用六周一款的迭代速度,把 Pro 缺席的空档填成了 Flash 的主场;而“高速循环堆智能”这条路线能不能成立,最终不取决于 DeepSWE 这类已被充分研究的任务,而取决于 Terminal-bench 4.0 那个 19.1%——下一款 Flash 发布时,这个数字会不会涨上来,比这次的 73.7% 更值得盯。

参考资料

Google 官方博客:Introducing Gemini 3.8 Flash and 3.8 Flash Cyber: https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/

Google DeepMind:Gemini 3.8 Flash 模型页: https://deepmind.google/models/gemini/flash/

Google AI for Developers:Gemini 3.8 Flash 模型文档: https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash

Google AI for Developers:Gemini API 定价页: https://ai.google.dev/gemini-api/docs/pricing

Google DeepMind:Gemini 3.8 Flash 模型卡: https://deepmind.google/models/model-cards/gemini-3-8-flash/

Google DeepMind:Gemini 3.8 Flash 评测方法: https://deepmind.google/models/evals-methodology/gemini-3-8-flash/

— THE END —

文章仅做学术分享,如有侵权请联系删除,非常感谢!

【声明】内容源于网络
0
0
AI大模型智能体前沿
分享AI大模型智能体前沿知识,探寻多元应用,洞察未来趋势,带你一路 “卷” 赢行业!🔥
内容 1111
粉丝 0
AI大模型智能体前沿 分享AI大模型智能体前沿知识,探寻多元应用,洞察未来趋势,带你一路 “卷” 赢行业!🔥
总阅读17.0k
粉丝0
内容1.1k