9 月 2 日,Google 正式发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber。两款模型共享基础能力,但定位截然不同:3.8 Flash 作为稳定版本,主攻编程、智能体及企业工作流;3.8 Flash Cyber 则专用于漏洞发现与修复,目前仅向经审核的政府部门、关键基础设施运营方及安全研究伙伴开放。
这是 Google 六周内第三次更新 Flash 系列。此次发布的核心信号在于:通用智能体与高风险网络安全模型开始实行差异化的开放策略。

图源:Google 官方发布页面
Flash 强化复杂任务执行能力
Google 将 Gemini 3.8 Flash 定位为面向编程和智能体的主力模型。它支持文本、图片、音频、视频和 PDF 等多模态输入,拥有约 100 万 Token 上下文窗口,单次最大输出约 6.5 万 Token。
在工具调用方面,3.8 Flash 支持代码执行、函数调用、文件搜索、搜索增强及结构化输出,计算机操作能力处于预览阶段。值得注意的是,该版本暂不支持图片与音频生成,也不提供 Live API,输出形式仍以文本为主。
本次升级重点在于长任务执行力,即模型在处理大型软件工程、多步骤企业任务时,能否持续调用工具并根据反馈动态调整方案。目前,3.8 Flash 已在 Gemini API、Google AI Studio、Gemini 应用及企业代理平台等渠道上线,具体可用范围受地区与订阅方案限制。
价格方面,3.8 Flash 延续 3.7 版本标准:每百万输入 Token 0.75 美元,输出 3.75 美元。该费率执行至 2026 年底,2027 年起将上调,免费层仍设有额度限制。
长周期任务表现显著
测试数据显示,3.8 Flash 在编程、金融分析及专家推理等长周期任务上进步明显。在 DeepSWE v1.1(长周期软件工程)测试中,其得分为 73.7%,略低于 Claude Opus 5(74.0%),但高于 GPT-5.6 Sol(72.7%)。
其他关键基准测试成绩如下:
- Vals Finance Agent v2:61.4%
- Terminal-bench 2.1:89.4%
- HLE-Verified:54.9%
- CharXiv Reasoning:86.2%

图源:Google;不同模型成绩由 Google 按照其测试设置整理
然而,3.8 Flash 并非全场景领先。在 Terminal-bench 4.0 中,其得分仅为 19.1%,远低于 Claude Opus 5 的 51.8% 和 GPT-5.6 Sol 的 37.3%;在 OSWorld 计算机操作和 GDPval 知识工作测试中也未获最高分。这表明其优势主要集中在长周期编程、金融分析、图表理解及部分专业推理任务,而在通用计算机操作等场景中表现仍有差异。
Cyber 版专注漏洞发现与修复
Gemini 3.8 Flash Cyber 针对网络安全场景深度优化,核心能力包括漏洞发现、代码风险分析及修复补丁生成。
在 Google 公布的 CyberGym 测试中,3.8 Flash Cyber 在 C/C++漏洞发现任务上的 Pass@1成绩达 86.2%,显著优于前代 3.5 Flash Cyber 的 77.5%。此外,在覆盖 20 种编程语言的内部复杂代码库测试中,其漏洞发现成功率超过 70%。

图源:Google;测试成绩及对比模型设置由 Google 披露
在外部补丁测试 CWE-Bench 中,3.8 Flash Cyber 的 Pass@1为 47.2%,略低于 Fable 5 的 47.8%,但 Google 强调其单次任务成本更低。
鉴于漏洞挖掘能力的“双刃剑”特性,Google 未将其纳入普通 API,而是通过新设立的"Fairwind 计划”实行受控访问。优先授权对象包括:
- 政府及国家网络安全主管部门;
- 医疗、能源、通信和金融等关键基础设施运营方;
- 影响广泛的核心技术平台;
- 从事防御性评估的安全研究机构与学术实验室。
获准机构需实施严格的身份认证、多因素验证及访问控制,权限仅限内部安全、应急响应或渗透测试团队使用,严禁转售或共享。
差异化安全边界与部署策略
尽管共享基础智能,3.8 Flash 与 Cyber 版在安全限制和部署环境上采取了截然不同的策略。普通版保留了针对网络攻击及生化核风险的严格围栏;而 Cyber 版为深入安全研究,放宽了部分网络安全限制,转而依靠机构审核、权限管理和全流程监控来确保安全。
这一安排折射出大模型安全思路的转变:当模型具备自主调用工具和寻找漏洞的能力时,仅靠对话层面的内容过滤已不足够。使用者身份、工具连接权限及操作记录已成为安全机制的核心组成部分。
此外,官方模型卡披露了一些值得关注的细节:首先,Google 未公开 3.8 Flash 的参数规模、训练数据量及算力消耗;其次,其多语言安全自动评估指标较 3.7 Flash 回退了 5.4 个百分点,Google 解释多为误报,但仍需持续观察;最后,在高强度推理下,模型可能出现响应延迟、超时或 Token 消耗增加的情况。这意味着"Flash"并不等同于在所有场景下都更快、更便宜,开发者需结合实际任务复杂度评估成本。
Google 争夺智能体生态入口
Gemini 3.8 Flash 双版本的同步发布,标志着 Google 正推动 Flash 系列深入复杂生产场景。一方面,利用高性价比承担长周期编程与企业智能体任务;另一方面,通过受控计划探索高风险专业模型的开放边界。
虽然此次发布未证明 Google 在所有基准测试中全面领跑,但其战略意图清晰:Flash 不再仅仅是轻量级快速响应模型,而是正在成为 Google 智能体产品体系的主力引擎。最终决定其竞争力的,将是其在真实项目中稳定完成长任务的能力,以及 Cyber 版在安全约束下提升漏洞修复效率的实际表现。
信息来源:
END

