Gemini 3.8 Flash 正式发布: Coding 能力跃升,定价维持不变
Gemini 3.8 Flash 已正式发布。在 LMArena Agent 榜单中,该模型空降第 14 名,以微弱优势超越 DeepSeek-V4-Pro。作为一款主打高性价比的 Flash 系列模型,其表现超出预期,且定价与 3.7 Flash 保持一致。
从谷歌披露的数据来看,Gemini 采取了独特的技术路线。不同于 OpenAI 和 Anthropic 致力于用更少步骤完成任务,谷歌倾向于增加推理步骤,通过多轮循环(Loop)提升结果质量。这种策略虽弥补了模型智能的不足,但也导致其极度依赖输出速度。目前,3.8 Flash 是市面上生成速度最快的模型,吞吐量约为第二名 Meta 模型的两倍。
然而,也有观点指出该模型存在“刷分”嫌疑。在 Terminal-bench 4.0 等近期发布的基准测试中,新版 Gemini 表现不佳。尽管如此,谷歌近期人事变动频繁,包括 Jeff Dean 离职,却在六周内连续推出三款 Flash 模型,显示出其在研发节奏上的加速。
Gemini 3.8 Flash:以高算力换取性能突破
3.8 Flash 定位为高性价比模型,性能较 3.7 Flash 大幅提升,在多数场景下已逼近旗舰模型。在 DeepSWE v1.1 基准测试中,它能端到端自主解决复杂工程问题,得分超过众多参数量更大的前沿模型,而成本仅为后者零头。
在金融和法律等企业级 Agent 场景中,该模型同样优于 3.7 Flash 及其他竞品。在 HLE-Verified(涵盖 STEM、人文及专业领域的多步推理测试)中,其得分为 54.9%,与旗舰模型的差距显著缩小。
值得注意的是,这一成绩主要源于“暴力计算”。面对复杂任务,3.8 Flash 会通过增加推理步骤、反复迭代调用工具来完成,这意味着在高负载场景下,其 Token 消耗量可能高于前代产品。若仅看单位 Token 的智能产出,其性价比优势有所减弱。行业观察认为,谷歌若想重回第一梯队,仍需等待 Pro 系列的进一步突破。
专攻网络安全的 3.8 Flash Cyber 模型
谷歌同步发布了专为网络安全设计的 3.8 Flash Cyber 模型,这是谷歌史上最强的安全专用模型,专注于自主发现漏洞和自动生成补丁。
在 CyberGym 漏洞发现测试中,该模型超越了 3.5 Flash Cyber 及多款大型前沿模型。在覆盖 20 种编程语言的内部代码库测试中,其漏洞挖掘成功率超过 70%。在修洞方面,CWE-Bench 测试显示其 pass@1 达到 47.2%,与当前领跑模型(47.8%)基本持平,但成本低得多。
实战数据显示,该模型已在谷歌内部部署。Chrome 安全团队使用它生成的正确补丁数量是最强商业模型的 2.6 倍;Wiz 公司利用其进行内部渗透测试,召回率提升了 7.5 至 9.7 个百分点,成本仅为其他模型的 20% 至 40%。Google Cloud 漏洞研究团队更在不到两小时内挖掘出一个以往需数月研究的关键基础漏洞。
由于能力过于强大,该模型不对外公开发布,仅通过 Fairwind 计划向受信任的防御者开放。
行业动态:Meta 发布 Muse Spark 1.3
在谷歌发布新模型的同时,Meta 也推出了 Muse Spark 1.3。该模型对标 Opus 5,在 Agent 和编码能力上均有显著提升,并间接对竞争对手进行了调侃。
参考链接:
https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/

