Google 近日正式发布三款 Gemini 新模型:Gemini 3.6 Flash、3.5 Flash-Lite 及 3.5 Flash Cyber。此次更新旨在解决 AI Agent 在生产环境中“跑不起来、跑不起”的核心痛点,分别从 Token 效率、推理速度及代码安全三个维度进行突破。
3.6 Flash 致力于以更少 Token 完成更复杂任务;3.5 Flash-Lite 将输出速度提升至每秒 350 Token;3.5 Flash Cyber 则专攻代码安全漏洞的挖掘与修复。
更少 Token,更强效能:Gemini 3.6 Flash
作为新一代主力工作模型,Gemini 3.6 Flash 直接对标上一代 3.5 Flash,重点解决多步骤工作流中 Token 消耗高、推理步骤冗余及工具调用频繁导致的成本问题。
据 Artificial Analysis Index 测评,完成同等任务时,3.6 Flash 的输出 Token 用量比 3.5 Flash 减少 17%。在 Datacurve 的 DeepSWE 基准测试中,这一优势扩大至 65%,显著降低了整体运行成本。
在 OSWorld 验证任务中,3.6 Flash 展现出更高的 Token 效率与更少的冗余输出,性能全面超越前代且价格更具竞争力。
在具体能力指标上,DeepSWE 代码得分从 37% 提升至 49%,MLE Bench 机器学习研究得分从 49.7% 跃升至 63.9%。计算机操作能力(OSWorld-Verified)从 78.4% 提升至 83.0%。值得注意的是,Computer Use 功能现已作为内置客户端工具,直接集成于 Gemini API 和 Enterprise 版本中。
知识工作方面,GDPval-AA v2 得分由 1349 提升至 1421。Hebbia、Harvey 等客户反馈显示,该模型在文档解析、图表数据分析及报告起草等多模态任务上表现优异。例如,利用画布功能可辅助开发 3D 工作流中的摄影纹理提取器。
结合 Google Antigravity 与 tldraw 离线编辑器,3.6 Flash 凭借强大的视觉理解能力,可构建交互式主题工作室。
安全层面,该模型出厂即配备增强版 Frontier Safety 防护,覆盖化学、生物、放射性、核(CBRN)及网络攻击滥用领域,在大幅提升抗越狱能力的同时,优化了正当用途的响应准确率。
每秒 350 Token:Gemini 3.5 Flash-Lite
3.5 Flash-Lite 定位为高吞吐、低延迟场景的首选,主打极速与低成本。其输出速度高达每秒 350 Token,定价低至输入每百万 0.3 美元、输出每百万 2.5 美元。
该模型为开发者提供了灵活的“思考等级”调节机制:在 Agent 搜索、文档批处理等场景中可调至最低以获取极致速度与低成本;在多步骤子 Agent 工作流中则可提升思考等级以胜任复杂任务。Computer Use 同样已内置集成。
相比上一代 3.1 Flash-Lite,其性能显著提升:Terminal-Bench 2.1 从 31% 升至 54%,长上下文 GDM-MRCR v2 从 60.1% 升至 72.2%,真实任务执行 GDPval-AA v2 从 642 飙升至 1140。
在多项评测中,3.5 Flash-Lite 甚至超越了上一代标准版 3 Flash:SWE-Bench Pro 得分为 54.2%(3 Flash 为 49.6%),OSWorld-Verified 得分为 74.0%(3 Flash 为 65.1%)。
应用场景方面,该模型不仅能从庞大电商数据集中高效提取产品特征,还可与 3.6 Flash 协同作为主 Agent,即时生成数十个独特的可探索网页设计概念。
专攻代码安全:Gemini 3.5 Flash Cyber
针对 AI 发现漏洞速度远超人工修复速度的现状,Google 推出基于 3.5 Flash 微调的专用模型——3.5 Flash Cyber。
该模型嵌入 CodeMender 代码安全 Agent 中,通过多 Agent 协同工作输出合并报告。在 CyberGym 主流基准测试中,其表现出前沿水平的竞争力,且单 Token 成本远低于大型模型。
鉴于该技术具有双重用途风险,Google 采取谨慎部署策略:3.5 Flash Cyber 不公开发布,仅作为限量试点项目,通过 CodeMender 向政府及受信任合作伙伴开放,旨在协助防御者抢先修复关键漏洞,同时严控滥用风险。
未来展望
关于备受期待的 Gemini 3.5 Pro,Google 表示正在与合作伙伴进行测试,将在准备就绪后广泛开放。此外,团队已启动 Gemini 4 的预训练,官方称此为迄今最具野心的一次预训练运行。
参考资料:
- Google AI Studio Official Updates
- Google Blog: Gemini Models and Research
- DeepMind Model Evaluation Reports

