谷歌新模型发布:主打性价比,高端旗舰仍“搁浅”
近期大模型领域竞争激烈。6 月至 7 月间,Anthropic、OpenAI、月之暗面及阿里相继发布 Claude Fable 5、GPT-5.6 Sol、Kimi K3 和 Qwen3.8-Max 等重磅模型,参数规模与性能不断刷新纪录。在此背景下,谷歌正式推出 Gemini 3.6 Flash,以及面向特定场景的 3.5 Flash-Lite 和政府专用版 3.5 Flash Cyber。然而,备受期待的旗舰模型 3.5 Pro 依旧处于延期状态。
核心策略:Token 效率优先
Gemini 3.6 Flash 的升级重点并非单纯的性能突破,而是显著提升 Token 使用效率以降低成本。在长周期编程任务 DeepSWE 测试中,新版模型平均输出 Token 量从 27.6 万降至 9.7 万,节省幅度达 65%。与此同时,输出定价由每百万 Token 9 美元下调至 7.5 美元,明确指向“降本增效”的市场策略。
性能表现:纵向有余,横向不足
从纵向对比来看,Gemini 3.6 Flash 相较于上一代确有进步:DeepSWE 得分从 37% 提升至 49%,MLE-Bench 从 49.7% 涨至 63.9%,OSWorld-Verified 从 78.4% 增至 83.0%。
然而,置于全球第三方评测机构 Artificial Analysis 的排行榜中,其竞争力显得乏力。Gemini 3.6 Flash 综合得分仅为 50 分,与旧版 3.5 Flash 持平,在涵盖 187 个模型的榜单中排名第 11 位。相比之下,Claude Fable 5(60 分)、GPT-5.6 Sol(59 分)、Kimi K3(57 分)等竞品均大幅领先,谷歌模型已无缘前十。
尽管谷歌官方博客通过内部对比展示增长趋势,但在关键的外部基准测试中差距明显。在软件工程测试 SWE-Bench Pro 中,3.6 Flash 得分为 58.7%,落后于 GPT-5.6 Luna(62.7%)、Grok 4.5(64.7%)及 Claude Sonnet 5(63.2%)。尤其在 DeepSWE 测试中,3.6 Flash 仅获 49%,而即便是 GPT-5.6 系列中最便宜的 Luna 版本也达到了 67%。
旗舰延期:3.5 Pro 陷入困境
谷歌曾在 5 月 I/O 大会承诺次月发布 Gemini 3.5 Pro,但至今未能兑现。据悉,该模型在编程任务上未达内部预期,经历更换训练数据重训及 DeepMind 团队重构关键部分后,进度依然滞后。受此消息影响,谷歌母公司 Alphabet 股价曾出现波动。目前官方口径仍为“正在与合作伙伴测试”。距离谷歌上一次发布 SOTA 级别模型 Gemini 3.1 Pro 已过去近半年。
轻量级亮点:3.5 Flash-Lite
相较于表现平平的 3.6 Flash,小杯版的 3.5 Flash-Lite 更具看点。其 API 定价极具竞争力:输入每百万 Token 0.3 美元,输出 2.5 美元,且输出速度高达 350 token/s。虽然在绝对性能上与 3.6 Flash 相差无几,但其“又快又便宜”的特性精准切入了高性价比赛道,这与此前马斯克 Grok 4.5 的市场策略不谋而合。
当前,下一代预训练工作已然启动,而上一代 Pro 版本仍在测试阶段。谷歌在大模型竞争中,似乎正暂时放弃性能军备竞赛,转而死磕 Flash 系列的效率与成本优势。

