这是我的第492篇Ai笔记,本篇2076、累计笔记7318467
彩蛋:结尾扫描二维码,领取《Gemini 3.8 Flash 实战手册》。
刚刚,谷歌正式发布了 Gemini 3.8 Flash,以及专门负责网络安全的 Gemini 3.8 Flash Cyber。
这次有点意思。
过去大家对 Flash 的印象很明确:快、便宜、适合走量。真正碰上复杂代码、长任务或者高难度 Agent,还是得请 Opus、GPT 这些旗舰模型。
但 Gemini 3.8 Flash 开始把这条边界搅乱了。
在专门测试真实软件工程能力的 DeepSWE v1.1 中,它拿到了 73.7%,Claude Opus 5 是 74.0%,GPT-5.6 Sol 是 72.7%。
价格却还是 Flash:每百万 Token 输入 0.75 美元,输出 3.75 美元。
一个便宜模型,开始摸到旗舰模型的能力区间。
所以我觉得,这次真正值得看的,已经不只是“Gemini 又变强了”。
谷歌正在试一种新的模型打法:单次不一定最聪明,但足够快、足够便宜,就让它多干几轮,把答案硬算出来。
谷歌自己其实把答案说得很直白:
Gemini 3.8 Flash works harder——它会干得更卖力。
碰到复杂任务,它会增加推理步骤,更频繁地调用工具,执行、检查、修改,然后继续往下跑。代价也很明显:高推理强度下,它可能消耗更多 Token。
这背后的思路,我觉得比几个 Benchmark 第一更重要。
以前我们总在比哪个模型“一次回答最聪明”。进入 Agent 时代以后,评价标准正在变:一个模型只要够快、够便宜,就可以允许它反复试错、调用工具、自我修正。
一次没想明白?
那就便宜地再想一次。
DeepMind 的姚顺宇在发布后用了一个很有意思的评价:“对模型来说是一小步,对 RSI 来说是一大步。”
RSI 指递归式自我改进。现在距离真正的 AI 自我进化当然还远,但方向已经出现了:
未来的大模型,可能不只拼谁脑子最大,还要拼谁能用更低的成本连续干活。
这次更新里,我觉得最值得看的有三个地方。
01|Coding:Flash 开始抢旗舰模型的活
Gemini 3.8 Flash 最亮眼的就是软件工程。
DeepSWE v1.1 测的是 AI 能不能真正处理一个长周期代码任务:读项目、修改文件、调用工具、运行代码、发现错误,再继续修。
3.8 Flash 拿到 73.7%,距离 Claude Opus 5 的 74.0% 只有 0.3 个百分点。
真正麻烦的地方在于成本。
如果以前一个复杂 Agent 必须全程调用昂贵旗舰模型,现在 Flash 能靠多轮执行把事情做完,开发者就可以把绝大多数任务交给便宜模型,只有解决不了的少数问题再升级到旗舰模型。
对于一天要跑几百、几千次任务的 AI 产品,这笔账差别非常大。
02|专业 Agent:便宜模型开始进入复杂业务
它也不只会写代码。
金融 Agent 测试中,3.8 Flash 得到 61.4%,高于 Claude Opus 5 的 58.6%;法律 Agent 测试中,它是 10.0%,Opus 5 是 6.7%。HLE-Verified 复杂推理测试也达到了 54.9%。
当然,跑分不能直接等于真实生产能力。
但至少说明了一件事:以前只有旗舰模型才有资格接的复杂任务,Flash 已经开始进场了。
以后企业部署 Agent,很可能变成分级用模型:大多数工作 Flash 干,真正难题再交给更贵的模型。
03|Cyber:这个更狠,但普通人玩不到
谷歌这次还发布了 Gemini 3.8 Flash Cyber,专门负责发现漏洞和自动修补代码。
Chrome 安全团队使用后,它生成的正确补丁数量是大型商业模型的 2.6 倍;Google Cloud 漏洞研究团队甚至用它不到两小时,发现了一个过去通常需要研究数月才能找到的关键漏洞。
不过谷歌也没敢直接放出来。
目前它只通过 Fairwind 计划向受信任的防御机构开放,普通用户暂时不用惦记。
夸完了,该泼的冷水还是得泼。
第一,跑分很猛,但偏科也很明显。
Terminal-Bench 4.0 里,3.8 Flash 只有 19.1%,Claude Opus 5 是 51.8%;OSWorld 2.0 也是 59.0% 对 75.4%。
所以“接近 Opus”只适用于部分任务,别急着理解成已经全面追平旗舰模型。
第二,它有点靠 Token 换能力。
复杂任务中,3.8 Flash 会增加推理步骤和工具调用,所以高推理模式可能明显多烧 Token。
以后别只看“每秒输出多少 Token”,最终还得看整个任务花多少钱、跑多久、最后干没干成。
第三,便宜归便宜,别直接拿跑分做生产决策。
Flash 最大的优势,是低单价加高速循环。但真实业务还有上下文稳定性、工具调用成功率、长任务一致性,这些 Bench 都很难完全覆盖。
真准备接进业务,先拿自己的任务狠狠干一轮,再决定要不要换模型。
最后,老规矩,用三句话总结一下。
1. Gemini 3.8 Flash 最大的变化,是 Flash 开始从“便宜快模型”,变成能长期执行复杂 Agent 任务的主力模型。
2. 它还没有全面追平 Opus 这样的旗舰模型,很多高分来自更长推理和更多工具调用,碰到陌生复杂环境依然会露怯。
3. 对普通开发者和企业来说,以后选模型别只问“谁最聪明”,更应该算清楚:谁能用最低总成本,把事情真正干完。
Gemini 3.8 Flash 这次参数和跑分很多,但真正用起来,更重要的是搞清楚:它到底适合干什么,哪些任务最能发挥优势,以及什么时候该直接换旗舰模型。
所以我给大家整理了一份 《Gemini 3.8 Flash 实战手册》。
里面重点整理了它目前最值得用的 Coding、Agent、专业工作流等场景,以及不同任务下怎么写提示词、怎么设置推理强度、怎么利用它“速度快+成本低+多轮循环”的特点,把优势真正发挥出来。
不想自己翻一堆官方资料的,直接拿这份照着用就行。
扫码回复关键词【38】,即可获取《Gemini 3.8 Flash 实战手册》。

