⭐ 设为星标 · 第一时间收到推送
Google 一口气补了三块 Flash 拼图
这次的主角是 Gemini 3.6 Flash。Google 把它定义为新的“主力模型”:继续做编码、知识工作、多模态和 Agent 任务,但重点优化了输出长度、推理步骤和工具调用次数。
剩下两款分工更明确。3.5 Flash-Lite 面向文档处理、搜索、翻译、分类这类高频任务;3.5 Flash Cyber 则被放进 CodeMender,用多个安全 Agent 协作发现、验证并修复软件漏洞。
| 模型 | 主要定位 | API 价格(每百万 token) | 开放范围 |
|---|---|---|---|
| Gemini 3.6 Flash | 编码、知识工作、多模态、Agent | 输入 1.50 美元 / 输出 7.50 美元 | Gemini App、AI Studio、Gemini API、Android Studio、Antigravity、企业平台 |
| Gemini 3.5 Flash-Lite | 高吞吐、低延迟、批量处理 | 输入 0.30 美元 / 输出 2.50 美元 | Gemini App、AI Studio、Gemini API、Android Studio、企业平台,并开始进入 Google Search |
| Gemini 3.5 Flash Cyber | 漏洞发现与修复 | 未公开 | 仅通过 CodeMender 向政府和可信伙伴做限量试点 |
官方发布图把三款模型放在一起,但不要被命名绕晕:3.6 Flash 是主力升级,Flash-Lite 是“量大管饱”,Cyber 是受控部署的安全专版。
3.6 Flash 和 3.5 Flash-Lite 都支持文本、图片、音频和视频输入,上下文窗口最高 100 万 token,输出最高 64K token。两款模型的知识截止时间都是 2026 年 3 月。API 里的模型名也很直接,分别是 gemini-3.6-flash 和 gemini-3.5-flash-lite。
顺带一提,Google 还在公告里确认:Gemini 3.5 Pro 正在与合作伙伴测试;Gemini 4 已经开始了新一轮预训练。只是这两件事现在都还没有公开可用时间表。
3.6 Flash 先把冗余步骤砍掉
模型发布最容易讲成一串 benchmark。我更在意 3.6 Flash 的另一个变化:完成同一件事,尽量少走弯路。
Google 援引 Artificial Analysis 的数据称,3.6 Flash 相比 3.5 Flash 平均少用 17% 的输出 token;在 DeepSWE 这类特定基准中,最高能少 65%。它还会减少不必要的推理步骤、工具调用和代码修改循环。对要长期运行 Agent 的团队来说,这些变化会同时影响延迟和账单。
下面这张官方图给出了四组对比。3.6 Flash 在 DeepSWE 上从 37% 提升到 49%,MLE-Bench 从 49.7% 提升到 63.9%,OSWorld-Verified 从 78.4% 提升到 83.0%;知识工作基准 GDPval-AA v2 也从 1349 提到 1421。
这些数字说明它对编码、计算机操作和多步任务做了有针对性的改进,但不能直接等同于“所有推理任务都更强”。Benchmark 测的是一组固定任务,真实工作流还会受到 Prompt、工具质量、上下文长度和模型稳定性的影响。
价格要和 token 用量分开看。3.6 Flash 的标价是输入 1.50 美元、输出 7.50 美元;一项任务到底省多少钱,还得看模型能否用更短输出、更少工具调用把事情做完。Google 这次的卖点其实很朴素:单价降一点,token 再少一点。
Flash-Lite 管吞吐,Cyber 管最敏感的代码
3.5 Flash-Lite 的逻辑更简单:如果任务需要跑几十万次,速度和单价往往比“单次回答有多惊艳”更重要。Google 给出的数据是约 350 输出 token/秒,适合文档处理、商品信息抽取、搜索、翻译、分类和批量子任务。
它并不只是把能力砍掉换低价。官方基准里,3.5 Flash-Lite 在 Terminal-Bench 2.1 上从上一代的 31% 提到 54%,长上下文 GDM-MRCR v2 从 60.1% 提到 72.2%,OSWorld-Verified 达到 74%。不过在更复杂、容错率更低的任务上,还是应该先拿自己的数据试跑,而不是只看“Lite”或一张榜单做决定。
Cyber 版走的是另一条路。它基于 3.5 Flash 做安全专项训练,再交给 CodeMender 编排多个 Agent,完成漏洞发现、验证和修复。Google 展示的 CyberGym、Big Sleep 和 Chrome 生产代码扫描结果都不差,其中 Big Sleep 评测从普通 3.5 Flash 的 36%、3.6 Flash 的 42%,提升到 72%。
但它不会像普通 Gemini API 模型那样直接开放。Google 明确把它限制在政府和可信伙伴的 CodeMender 试点里,原因也很现实:一个会自动找漏洞、写补丁的模型,同样具有明显的双重用途风险。
早期实测很亮眼,分歧也来得很快
发布后几小时,已经有人把 3.6 Flash 接进自己的工作流。Gordon Cassie 报告 token 数减少 37%、整体耗时减少 60%;Michael Guo 分享的另一组测试里,延迟从 73 秒降到 34 秒,token 从 112,421 降到 68,483,同时保持 10/10 的任务准确率。这些结果和 Google 主打的“少推理、少调用、快完成”基本同向。
负面反馈也很具体。计算生物学研究者 Serafim Batzoglou 在自己的 induction benchmark 上测到,3.6 Flash 的正确率略低于 3.5 Flash;他同时承认,新模型速度很快、批处理返回稳定,而且能找到更简洁的公式。开发者 Gatien 的几组测试则显示,新版在部分任务中不如 Flash Preview。
下面这张社区评测图里,3.6 Flash 在这项特定推理任务上得到 7.8% 的正确率,低于 3.5 Flash 的 10.9%。测试者也强调,差距可能处于噪声范围内。这张图推翻不了官方基准,官方基准也替你验证不了自己的业务。
如果你主要做编码 Agent、计算机操作、多模态文档分析,3.6 Flash 值得拿现有任务做一轮 A/B 测试,重点记录成功率、总 token、工具调用次数和端到端耗时。批量抽取、翻译、分类、搜索优先试 Flash-Lite。Cyber 版则和绝大多数开发者无关,短期内不用等 API。
迁移 3.6 Flash 时,先盯四个数:成功率、总 token、工具调用次数和端到端耗时。社区的第一批结果已经说明,它不是所有任务上的无条件升级。用自己的 Prompt、工具和数据跑一遍,再决定迁移多少流量。

