大数跨境

谷歌又发新模型!Gemini 3.7 Flash:这次真正狠的,是把Agent成本直接砍了一半

谷歌又发新模型!Gemini 3.7 Flash:这次真正狠的,是把Agent成本直接砍了一半 我的Ai笔记
2026-08-19
0
导读:Gemini 3.7 Flash三周再升级:Agent更强、Coding更猛,年内价格直接减半。
点击蓝字,关注我们


这是我的第481篇Ai笔记,本篇4125、累计笔记8451943

彩蛋:结尾扫描二维码,领取《Gemini 3.7 Flash Agent 实战工具包》

引言

谷歌最近更新 Gemini 的速度,开始有点不讲武德了。

7 月 21 日,Gemini 3.6 Flash 才刚刚上线。结果仅仅过了三周,8 月 13 日,Gemini 3.7 Flash 又突然杀了出来。

更有意思的是,大家原本等的是更强的 Pro 旗舰模型,谷歌端上来的却依然是 Flash。但看完这次更新,我反而觉得,这个 Flash,可能比一款单纯刷榜的旗舰模型更值得普通开发者和做 Agent 的人关注。

因为谷歌这次干了一件很现实的事情:一边把 Coding、工具调用和 Agent 能力继续往上抬,一边把调用价格直接砍到了上一代的一半。

以前的 Flash 给人的印象,基本就是三个词:快、便宜、够用。现在谷歌显然想给它换一个岗位。

以后 Flash 可能不只是那个负责秒回你的“小模型”,而是躲在各种 Agent 后面,一天干几万、几十万次活儿的 AI 打工人。

而这件事,可能比某个 Benchmark 又拿了第一更重要。

思考

为什么我会这么说?

因为今天的大模型竞争,已经开始换题了。两年前大家比的是谁回答问题更聪明、谁数学分更高、谁写文章更像人。但到了 Agent 阶段以后,一个模型只会“答题”已经远远不够。

你让一个 AI 真正替你干活,它需要先看懂你的需求,再读几十个文件、调用搜索、改代码、执行命令、检查结果,发现错了以后再重新修改,中间甚至还要调用其他 Agent。

这时候真正麻烦的,已经不是“第一次回答够不够惊艳”,而是:

它能不能便宜、稳定地连续干几十步,最后真的把事儿做完。

这就是 Gemini 3.7 Flash 这次最值得关注的地方。Google 给它的官方定位也非常直接:workhorse model——主力工作模型。

这个词特别准确。

旗舰模型更像实验室里的超级跑车,负责告诉大家技术上限在哪里;Flash 则越来越像一辆天天跑物流的货车。它不需要每项比赛都是第一,但必须跑得够快、足够稳定、油钱不能太贵,还得一天开十几个小时。

而真正决定 AI 能不能进入公司、软件和普通人工作流的,往往就是后一种模型。

AI+

01|便宜模型开始往旗舰桌上挤了

咱们先不看几十项密密麻麻的跑分,只挑几个和真实工作最相关的。

在生产级代码测试 FrontierCode 1.1 Main 上,Gemini 3.6 Flash 是 34.4%,到了 3.7 Flash,直接冲到了 43.6%。

再看长周期软件工程测试 DeepSWE v1.1,从 49.0% 提升到了 65.3%。这个涨幅已经不是挤牙膏了。

尤其有意思的是,把 3.7 Flash 放进 Google 公布的横向成绩里,它在部分 Coding 项目上已经开始和旗舰模型坐一桌了。

FrontierCode 1.1 Main 中,Gemini 3.7 Flash 是 43.6%,Claude Sonnet 5 是 42.7%,GPT-5.6 Terra 是 41.3%。到了网页开发 WebDev Arena,3.7 Flash 也从上一代的 1538 Elo 提到了 1588 Elo。

当然,别急着喊“Flash 干翻所有旗舰”,还远远没有。像 DeepSWE、Terminal Bench 和复杂知识工作里,部分旗舰模型依然更强。

但这恰恰是这次更新最有意思的地方:谷歌根本没打算让 Flash 每门功课都考第一。

它想做的是,让一个原本便宜、快速的模型,在最常用的工作场景里,逐渐拥有接近旗舰模型的能力。

这就完全是另一种打法了。

02|Agent 才是这次真正的主菜

如果说 Coding 的提升还比较直观,那 Agent 数据更能看出谷歌到底想干什么。

在企业自动化测试 AutomationBench 上,3.6 Flash 是 17.0%,3.7 Flash 直接涨到了 30.4%。Terminal-bench 2.1 也从 78.0% 提升到了 85.8%,更难的 Terminal-bench 3.0,则从 5.4% 涨到了 14.9%。Computer Use 相关的 OSWorld 2.0,也从 33.8% 提到了 47.9%。

这些数字背后,其实都在测同一件事:AI 到底能不能自己继续往下干。

Google 这次甚至专门强调,3.7 Flash 在碰到障碍时,会更主动调整策略;需要的时候会澄清用户意图;复杂任务里还会投入更多推理资源。

翻译成人话就是,以前 AI 做到第三步卡住了,可能就停在那里等你救它。现在谷歌想让它自己想办法绕过去,然后继续干。

这才是 Agent 真正需要的能力。

毕竟我们做一个 Agent,不可能每隔两分钟站在旁边说:“这里点一下”“这个文件再读一下”“刚刚报错了,你重新来”。

那不叫智能体,那叫给 AI 当保姆。

03|官方已经开始把它往真实工作里塞了

这次 Google 也没打算让 Gemini 3.7 Flash 只活在模型排行榜里,它发布当天,就已经进入了不少真实产品。

开发者可以通过 Gemini API、Google AI Studio、Android Studio、Google Antigravity 使用它;企业侧则可以接入 Gemini Enterprise Agent Platform。普通用户这边,Google AI Pro 和 Ultra 用户使用的个人 Agent——Gemini Spark,也开始切换到 3.7 Flash。

这个 Spark 很值得注意。

Google 对它的设想,是一个能够长时间运行的个人 Agent,可以围绕 Gmail、Google Calendar、Docs 等 Workspace 工具连续执行任务,比如整理多个文件、起草邮件、更新项目状态、处理日历。

这就很明显了。Google 想让 Flash 从一个聊天框里的模型,开始进入真正的工作后台。

更夸张一点,Google 官方展示的案例已经包括:从文字生成可以玩的 3D 游戏,把静态 PDF 年报直接变成交互式数据网页,协调多个子 Agent 做网页开发,甚至参与机器人训练流程。

Flash 能干的工种,正在越来越多。

04|但我觉得这次真正狠的,还是价格

能力提升大家都能理解。真正让我觉得谷歌开始玩狠活的,是价格。

到 2026 年 12 月 31 日之前,Gemini 3.7 Flash 每百万输入 Token 是 0.75 美元,每百万输出 Token 是 3.75 美元。上一代对应价格分别是 1.5 美元和 7.5 美元。直接对半砍。

这里一定要注意,如果你只是偶尔打开 Gemini 问一句“帮我写个周报”,这点价格变化其实没什么感觉。但 Agent 完全是另一回事。

一个真正复杂的 Agent 任务,中间可能要经历读文件、搜索、思考、调工具、执行、检查、失败、重试、再检查。一项任务下来,模型可能被调用几十次甚至几百次。如果再乘上每天几万名用户,账单会非常恐怖。

所以到了 Agent 时代,模型价格绝对不只是“便宜一点”这么简单。

它决定了很多 AI 功能到底能不能真的开放给所有用户。

以前一个功能一次跑下来太贵,只能塞进高级会员。以后成本降下来,它可能直接变成软件里的默认功能。

就像今天没人会专门点击一个按钮说“我要使用云同步”,它就一直在后台运行。AI 未来也可能是这样,你不再主动“调用一次 AI”,它会一直在后台替你检查、整理、跟进、搜索和处理任务。

而 Flash 这种模型,恰好就是干这个活儿的。

祛魅与吐槽

夸了这么多,该泼的冷水还是得泼。

第一,跑分涨了,不等于 Agent 真能彻底放养

这是最重要的一点。

AutomationBench、Terminal Bench、OSWorld 都涨得非常漂亮,但 Benchmark 和你的真实电脑、真实项目、真实公司系统,完全是两回事。

真实任务里面有权限问题、有脏数据、有奇怪文件、有断网、有 API 报错,还有各种开发者自己都想不到的骚操作。

所以现阶段我不会因为几张漂亮表格,就宣布“Agent 已经可以无人值守了”。

还早。

能不能稳定连续跑几个小时,得看真实项目。

第二,它依然不是最强模型

部分 Coding 成绩已经非常猛,但把所有测试铺开,3.7 Flash 依然有明显短板。

尤其是更困难的软件工程、复杂知识工作和高难度推理任务,旗舰模型依旧有优势。所以以后更合理的用法,很可能是:普通高频任务交给 Flash,真正困难、关键的节点再升级到旗舰模型。

别让一个模型从扫地一直干到当 CEO。

没必要。

第三,半价有保质期

这次价格很香,但别忘了:只是介绍期价格。

按照目前公布的信息,2027 年 1 月 1 日之后,会恢复到输入 1.5 美元、输出 7.5 美元/百万 Token。

所以如果你真的准备把它接进产品,不能只拿今天的促销价做长期商业模型。先尝鲜可以,算成本的时候,还是得把恢复后的价格一起算进去。

第四,真正的大考还没来

Flash 三周一更确实很猛,但谷歌能不能重新站稳前沿,还不能靠 3.7 Flash 盖棺定论。

下一代旗舰模型什么时候出来?Coding、推理和可靠性到底能不能重新拉开差距?新的 DeepMind 管理方式到底能不能加快研发?

这些问题,Flash 都回答不了。

所以我更愿意把 3.7 Flash 看成:谷歌重新加速之后交出来的第一张答卷。

成绩不错,但还不是期末考试。

三句话

最后,老规矩,用三句话总结今天这次更新。

Gemini 3.7 Flash 最大的变化,不是又多了一个 0.1,而是 Flash 正在从“便宜快速的小模型”,变成真正面向 Coding、工具调用和 Agent 的主力工作模型。

年内价格直接减半,比几个 Benchmark 涨分更值得关注,因为 Agent 一旦开始连续干几十步,模型调用成本会被成倍放大,便宜本身就是生产力。

未来真正大量进入软件和企业工作流的,未必永远是排行榜最强的模型;更可能是这种“足够聪明、足够快、足够便宜,还能连续干活”的模型。

🎁彩蛋福利🎁

聊了这么多 Gemini 3.7 Flash,真正准备拿它干活,光看跑分肯定不够。

尤其是做 Agent,最容易踩的坑就是:什么任务都扔给一个模型、上线前没算成本、跑起来以后才发现重试次数比想象中高。

所以这次我给大家准备了一套 《Gemini 3.7 Flash Agent 实战工具包》

Flash 便宜是一回事,怎么把便宜真正变成生产力,是另一回事。

⬆️⬆️⬆️ 扫码回复关键词【FLASH】,这套《Gemini 3.7 Flash Agent 实战工具包》直接发给你。

【声明】内容源于网络
0
0
我的Ai笔记
很干货、有深度、真免费,关注“我的Ai笔记”,每天学Ai技巧! 赋能客户、助力普通人在Ai时代抢占先机。
内容 444
粉丝 1
我的Ai笔记 很干货、有深度、真免费,关注“我的Ai笔记”,每天学Ai技巧! 赋能客户、助力普通人在Ai时代抢占先机。
总阅读24.3k
粉丝1
内容444