大数跨境

Google 连发三款 Gemini,Agent 账单开始往下压

Google 连发三款 Gemini,Agent 账单开始往下压 石臻说AI
2026-07-22
6
导读:Google 同时发布三款 Gemini Flash:主力款减少 token 和调用步骤,Lite 版压低批量成本,Cyber 版只做受控试点。

⭐ 设为星标 · 第一时间收到推送

石臻说AI 编辑:石臻
导读: Google 一次更新了三款 Gemini Flash:面向日常和开发者任务的 3.6 Flash、追求吞吐和低成本的 3.5 Flash-Lite,以及专门找漏洞、补漏洞的 3.5 Flash Cyber。名字确实有点密。简单说,主力模型要少花 token,批量任务要压成本,安全模型则必须控制开放边界。

Google 一口气补了三块 Flash 拼图

这次的主角是 Gemini 3.6 Flash。Google 把它定义为新的“主力模型”:继续做编码、知识工作、多模态和 Agent 任务,但重点优化了输出长度、推理步骤和工具调用次数。

剩下两款分工更明确。3.5 Flash-Lite 面向文档处理、搜索、翻译、分类这类高频任务;3.5 Flash Cyber 则被放进 CodeMender,用多个安全 Agent 协作发现、验证并修复软件漏洞。

模型 主要定位 API 价格(每百万 token) 开放范围
Gemini 3.6 Flash 编码、知识工作、多模态、Agent 输入 1.50 美元 / 输出 7.50 美元 Gemini App、AI Studio、Gemini API、Android Studio、Antigravity、企业平台
Gemini 3.5 Flash-Lite 高吞吐、低延迟、批量处理 输入 0.30 美元 / 输出 2.50 美元 Gemini App、AI Studio、Gemini API、Android Studio、企业平台,并开始进入 Google Search
Gemini 3.5 Flash Cyber 漏洞发现与修复 未公开 仅通过 CodeMender 向政府和可信伙伴做限量试点

官方发布图把三款模型放在一起,但不要被命名绕晕:3.6 Flash 是主力升级,Flash-Lite 是“量大管饱”,Cyber 是受控部署的安全专版。

Google 同时发布三款 Gemini Flash 模型

3.6 Flash 和 3.5 Flash-Lite 都支持文本、图片、音频和视频输入,上下文窗口最高 100 万 token,输出最高 64K token。两款模型的知识截止时间都是 2026 年 3 月。API 里的模型名也很直接,分别是 gemini-3.6-flashgemini-3.5-flash-lite

顺带一提,Google 还在公告里确认:Gemini 3.5 Pro 正在与合作伙伴测试;Gemini 4 已经开始了新一轮预训练。只是这两件事现在都还没有公开可用时间表。

3.6 Flash 先把冗余步骤砍掉

模型发布最容易讲成一串 benchmark。我更在意 3.6 Flash 的另一个变化:完成同一件事,尽量少走弯路。

Google 援引 Artificial Analysis 的数据称,3.6 Flash 相比 3.5 Flash 平均少用 17% 的输出 token;在 DeepSWE 这类特定基准中,最高能少 65%。它还会减少不必要的推理步骤、工具调用和代码修改循环。对要长期运行 Agent 的团队来说,这些变化会同时影响延迟和账单。

下面这张官方图给出了四组对比。3.6 Flash 在 DeepSWE 上从 37% 提升到 49%,MLE-Bench 从 49.7% 提升到 63.9%,OSWorld-Verified 从 78.4% 提升到 83.0%;知识工作基准 GDPval-AA v2 也从 1349 提到 1421。

Gemini 3.6 Flash 在编码、机器学习、知识工作和计算机操作上的官方对比

这些数字说明它对编码、计算机操作和多步任务做了有针对性的改进,但不能直接等同于“所有推理任务都更强”。Benchmark 测的是一组固定任务,真实工作流还会受到 Prompt、工具质量、上下文长度和模型稳定性的影响。

价格要和 token 用量分开看。3.6 Flash 的标价是输入 1.50 美元、输出 7.50 美元;一项任务到底省多少钱,还得看模型能否用更短输出、更少工具调用把事情做完。Google 这次的卖点其实很朴素:单价降一点,token 再少一点

Flash-Lite 管吞吐,Cyber 管最敏感的代码

3.5 Flash-Lite 的逻辑更简单:如果任务需要跑几十万次,速度和单价往往比“单次回答有多惊艳”更重要。Google 给出的数据是约 350 输出 token/秒,适合文档处理、商品信息抽取、搜索、翻译、分类和批量子任务。

它并不只是把能力砍掉换低价。官方基准里,3.5 Flash-Lite 在 Terminal-Bench 2.1 上从上一代的 31% 提到 54%,长上下文 GDM-MRCR v2 从 60.1% 提到 72.2%,OSWorld-Verified 达到 74%。不过在更复杂、容错率更低的任务上,还是应该先拿自己的数据试跑,而不是只看“Lite”或一张榜单做决定。

Gemini 3.5 Flash-Lite 的价格与多项官方基准对比

Cyber 版走的是另一条路。它基于 3.5 Flash 做安全专项训练,再交给 CodeMender 编排多个 Agent,完成漏洞发现、验证和修复。Google 展示的 CyberGym、Big Sleep 和 Chrome 生产代码扫描结果都不差,其中 Big Sleep 评测从普通 3.5 Flash 的 36%、3.6 Flash 的 42%,提升到 72%。

Gemini 3.5 Flash Cyber 在 CyberGym 上的官方对比
Gemini 3.5 Flash Cyber 在 Big Sleep 评测上的结果

但它不会像普通 Gemini API 模型那样直接开放。Google 明确把它限制在政府和可信伙伴的 CodeMender 试点里,原因也很现实:一个会自动找漏洞、写补丁的模型,同样具有明显的双重用途风险。

早期实测很亮眼,分歧也来得很快

发布后几小时,已经有人把 3.6 Flash 接进自己的工作流。Gordon Cassie 报告 token 数减少 37%、整体耗时减少 60%;Michael Guo 分享的另一组测试里,延迟从 73 秒降到 34 秒,token 从 112,421 降到 68,483,同时保持 10/10 的任务准确率。这些结果和 Google 主打的“少推理、少调用、快完成”基本同向。

负面反馈也很具体。计算生物学研究者 Serafim Batzoglou 在自己的 induction benchmark 上测到,3.6 Flash 的正确率略低于 3.5 Flash;他同时承认,新模型速度很快、批处理返回稳定,而且能找到更简洁的公式。开发者 Gatien 的几组测试则显示,新版在部分任务中不如 Flash Preview。

下面这张社区评测图里,3.6 Flash 在这项特定推理任务上得到 7.8% 的正确率,低于 3.5 Flash 的 10.9%。测试者也强调,差距可能处于噪声范围内。这张图推翻不了官方基准,官方基准也替你验证不了自己的业务。

社区 induction benchmark:3.6 Flash 在这项特定任务中略低于 3.5 Flash

如果你主要做编码 Agent、计算机操作、多模态文档分析,3.6 Flash 值得拿现有任务做一轮 A/B 测试,重点记录成功率、总 token、工具调用次数和端到端耗时。批量抽取、翻译、分类、搜索优先试 Flash-Lite。Cyber 版则和绝大多数开发者无关,短期内不用等 API。

迁移 3.6 Flash 时,先盯四个数:成功率、总 token、工具调用次数和端到端耗时。社区的第一批结果已经说明,它不是所有任务上的无条件升级。用自己的 Prompt、工具和数据跑一遍,再决定迁移多少流量。

 
   📚 往期精选  

 4 秒出图、10 美分视频,Google 新媒体模型来了

 收到 $103 账单后,我用 15 组 prompt…

 一句话让 Codex 做 CAD,这个项目 8.3K…

 我真的服了,Codex这周真的卡成狗一样

 Anthropic教你如何剩Token费,96%的效果…

 Claude Code 用户可以试试这个插件

 Claude Loops:让 AI 睡觉时也在工作

 X MCP 上线:Agent 读 X 的实操流程

 美国商务部解禁Claude Fable5和Mythos5

 开源AI被喊危险,闭源巨头到底怕什么

【声明】内容源于网络
0
0
石臻说AI
AI科技博主,10年+大厂互联网经验,专注: AI资讯|生产力工具|AI提效 | 科技数码 用AI提效,剩下的时间摸鱼 , 🛰:szzdzhp001
内容 216
粉丝 0
石臻说AI AI科技博主,10年+大厂互联网经验,专注: AI资讯|生产力工具|AI提效 | 科技数码 用AI提效,剩下的时间摸鱼 , 🛰:szzdzhp001
总阅读1.4k
粉丝0
内容216