Google 今天一口气发了三款 Gemini 新模型:3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber。主角是 3.6 Flash,一个在多个维度上比前代更好、还更便宜的模型。
但如果你在等 Gemini 3.5 Pro,抱歉,还得接着等。
3.6 Flash:更快、更便宜、更省 token
先看价格。3.6 Flash 输出定价从 3.5 Flash 的 $9/百万 token 降到了 $7.50,输入价格不变($1.50)。
但真正有意思的不是降价,是省 token。
根据 Google 的数据,3.6 Flash 在 Artificial Analysis Index 上平均少用 17% 的输出 token。在某些 DeepSWE 编码测试中,token 消耗最多降低 65%。Artificial Analysis 的实测也印证了这一点:跑同一套评测,3.5 Flash 花了 $1041,3.6 Flash 只花了 $727,账单直接少了三成。
速度也有明显提升。3.6 Flash 的生成速度达到 304 tokens/s,3.5 Flash 是 165 tokens/s,接近翻倍。对于需要多步推理、反复调用工具的 Agent 工作流来说,每一步快一倍,最终的完成时间差距会被放大。
智能水平方面,3.6 Flash 在 Artificial Analysis Intelligence Index 上得分 50,和 3.5 Flash 持平——但用了更少的 token 达到同样的分数。
具体到各项基准:
- DeepSWE:49% vs 37%,代码编辑更精准,执行循环更少
- MLE-Bench:63.9% vs 49.7%,ML 研究任务大幅提升
- OSWorld-Verified:83.0% vs 78.4%,Computer Use 能力增强,且已作为内置客户端工具在 Gemini API 和 Gemini Enterprise 中提供
- GDPval-AA v2:1421 vs 1349,知识工作任务更强
知识截止日期也从 2025 年 1 月跳到了 2026 年 3 月——模型终于知道过去一年多发生的事了。
Google 还搬出了几家客户站台。Figma、Harvey、Hebbia、JetBrains 都表示 3.6 Flash 在成本和质量上都有进步,尤其在文档解析、图表数据分析、报告起草等多模态任务上表现突出。
安全方面,3.6 Flash 加强了 CBRN(化学、生物、放射性、核)和网络攻击滥用领域的前沿安全防护,对越狱攻击的抵抗力更强,同时对良性用途的拒答率更低。
放到竞品里看
3.6 Flash 在 OSWorld 和两项长上下文测试上领先。但 GPT 5.6 Luna 在 DeepSWE 和 Terminal-bench 上更强,Grok 4.5 在 SWE-Bench Pro 上领先,Claude Sonnet 5 在 MLE-Bench 和 GDPVal-AA v2 上得分最高。
四家模型在多数基准上差距不大。实际选择更多取决于具体任务和价格。
3.6 Flash 已经可以在 GitHub Copilot 中使用,同时上线了 Gemini 应用、Google AI Studio、Android Studio 和 Google Antigravity。Antigravity 是 Google 今年 5 月在 I/O 大会推出的 Agent 开发平台,定位是独立桌面应用,有点像 Google 版的 Claude Code + Cursor 合体。
3.5 Flash-Lite:快、便宜,还意外地强
3.5 Flash-Lite 走极致低价路线,定价 $0.30/$2.50(每百万 token 输入/输出),速度达到 350 tokens/s,是 3.5 系列里最快的模型。
但最让人意外的是它的性能。这个 Lite 模型在多项基准上不仅碾压了前代 3.1 Flash-Lite,甚至还超过了 3 Flash:
- SWE-Bench Pro:54.2% vs 49.6%(3 Flash)
- OSWorld-Verified:74.0% vs 65.1%(3 Flash)
- Terminal-Bench 2.1:54% vs 31%(3.1 Flash-Lite)
- GDM-MRCR v2(长上下文):72.2% vs 60.1%
- GDPval-AA v2:1140 vs 642
一个 Lite 模型在编码和 Agent 任务上干掉了上一代的主力模型,这有点离谱。
开发者可以根据工作负载配置不同的思考级别:低延迟、低成本场景用 minimal 和 low 模式,多步子代理任务用高思考级别。Computer Use 也作为内置工具提供。
Ashler、Palo Alto Networks、Ramp 等早期客户已经在用它跑高吞吐量产流量和数据处理。3.5 Flash-Lite 也会在 Google Search 中上线。
3.5 Flash Cyber:只给政府用的安全模型
3.5 Flash Cyber 基于 3.5 Flash 微调,专注网络安全漏洞的发现和修复。在 CodeMender 安全代理中,多个 Flash Cyber agent 协同工作,在 CyberGym 基准上达到前沿水平——83.2%,与 GPT-5.6 Sol(83.6%)和 Mythos 5(83.8%)几乎持平。
考虑到这类技术的双重用途风险,Google 采取了限制策略:3.5 Flash Cyber 仅通过 CodeMender 向政府和受信任合作伙伴开放,作为有限访问试点项目。
3.5 Pro 去哪了?
这次发布 Gemini 3.5 Pro 继续缺席。
Google 在 I/O 上承诺的旗舰模型至今没有公开发布。Bloomberg 此前报道,延期原因是模型在内部编码基准上表现不达预期,6 月底用新数据重新训练后结果仍然不理想。目前 3.5 Pro 只在少数合作伙伴和美国政府那里做测试,公开日期未知。
上次 3.5 Pro 跳票时,Google 推出了 Gemini 3.5 Flash,结果这个 Flash 模型反而在多项编码和 Agent 基准上打败了 Gemini 3.1 Pro。3.6 Flash 看起来也是类似的策略:不跟 GPT-5.6 或 Claude 争排行榜顶端,先把更快更便宜的生态位占住。
Google 同时确认,下一代 Gemini 4 已经启动了迄今最大规模的预训练。
关注公众号回复“进群”入群讨论

