谷歌发布 Gemini 3.8 Flash:代码能力比肩顶级旗舰,成本仅需五分之一
谷歌正式推出全新轻量级旗舰模型 Gemini 3.8 Flash。该模型在性能上实现显著突破,同时定价策略极具竞争力:当前维持原价并享受首发半价优惠。
价格对比一览
| 阶段 / 时间节点 | 每百万 Token 输入价格 (Input) | 每百万 Token 输出价格 (Output) | 状态 |
|---|---|---|---|
| 首发限时优惠(当前) | $0.75 美元 | $3.75 美元 | 现已上线 |
| 2027 年起(恢复原价) | $1.50 美元 | $7.50 美元 | 预计恢复 |

▲ 图 1:Google 官方控制台中已支持选择 Gemini 3.8 Flash 系列模型
一、研发节奏加速:六周连发三款 Flash 模型
谷歌近期展现出惊人的研发与发布效率,在短短 6 周内连续推出了三款 Flash 系列模型:
- 7 月 21 日:Gemini 3.6 Flash
- 8 月 13 日:Gemini 3.7 Flash
- 今日:Gemini 3.8 Flash
平均两周迭代一代模型的频率,给整个 AI 行业带来了前所未有的竞争压力。

▲ 图 2:谷歌 CEO Sundar Pichai 亲自发文宣布 Gemini 3.8 Flash 上线
二、性能评测:轻量模型对标顶级旗舰
此次官方评测将参照标准大幅提升,Gemini 3.8 Flash 直接对标 Claude Opus 5 与 GPT-5.6 Sol 等头部厂商的顶配超大旗舰模型。

▲ 图 3:Gemini 3.8 Flash 与 GPT-5.6 Sol、Claude Opus 5 的全方位跑分对比
1. 编程能力:与 Claude Opus 5 持平
在代码生成与解决真实工程问题方面,Gemini 3.8 Flash 表现优异,与 Claude Opus 5 几乎战平:
- DeepSWE:73.7% vs 74.0%
- Terminal-bench 2.1:89.4% vs 89.1%
在知名数据公司 Datacurve 构建的第三方编程基准 DeepSWE(涵盖 91 个真实开源仓库的 113 道硬核代码修补任务)测试中,Gemini 3.8 Flash 与 Opus 5 的通过率均为 74%,并列全球第一。

▲ 图 4:第三方机构 Datacurve 的 DeepSWE 代码基准测试榜单
2. 极致性价比:性能相当,成本仅为旗舰 1/5
虽然两者得分同为 74%,但成本差异巨大:
| 评估模型 | DeepSWE 任务通过率 | 平均单题消耗成本 | 综合成本倍数 |
|---|---|---|---|
| Gemini 3.8 Flash | 74% | $2.36 美元 | 基准 (1x) |
| Claude Opus 5 | 74% | $11.84 美元 | 贵 5 倍 (5x) |
在“得分 - 成本”性价比象限图中,Gemini 3.8 Flash 位居右上角最顶端,被官方标注为"Most Efficient"(全场最高效)。即便是主打性价比的 GLM-5.3,其效率也低于该模型。

▲ 图 5:各大主流模型在 DeepSWE 榜单上的性价比象限图
短短 4 个月,谷歌将 Flash 系列在 DeepSWE 上的通过率从 3.5 时代的 35% 提升至 3.8 的 74%,且在追平顶级旗舰的同时,单题调用成本基本保持不变。
3. 垂直领域 Agent 能力反超
在金融 Agent(Finance Agent)和法律 Agent(Legal Agent)两项专业垂直领域测试中,Gemini 3.8 Flash 的表现甚至超越了同台竞技的旗舰大模型。

▲ 图 6:Gemini 3.8 Flash 在金融与法律垂直领域 Agent 评测中的领先表现
三、客观分析:模型存在的局限性
尽管在代码与垂直任务上表现突出,Gemini 3.8 Flash 并非全能模型,仍存在以下短板:

▲ 图 7:Terminal-bench 多版本跑分及细分能力对比
1. 超长程复杂任务处理能力不足
在评估长流程、多步骤复合任务能力的 Terminal-bench 4.0 榜单上:
- Claude Opus 5:得分 51.8%
- Gemini 3.8 Flash:得分 19.1%
面对极度复杂的连续长任务时,Flash 模型在深度推理与长程规划能力上与顶级旗舰仍有明显差距。

▲ 图 8:技术社区关于 Terminal-bench 4.0 长程任务表现差距的讨论
2. 综合泛化智力属第二梯队
在权威评测机构 Artificial Analysis 的模型综合智力榜单上:
- Gemini 3.8 Flash:综合得分 59 分,位列第 8;
- 整体水平与 Kimi K3、GLM-5.3 处于同一档位,略低于 GPT-5.6 Sol(差 2 分)。

▲ 图 9:Artificial Analysis 全球大模型综合智力排行榜
四、技术解析:基于后训练技术的突破
综合排名第八却能在单项代码能力上跻身全球前二,其技术路径如下:
- 底座未变:Gemini 3.8 Flash 是在 3.7 Flash 基础上继续训练而成,3.6 和 3.7 同样基于同一底座。
- 知识截止未更新:历代模型卡的知识截止日期均停留在 2025 年 1 月,表明期间未进行大规模重新预训练。
这三代 Flash 的性能飞跃完全依赖后训练(Post-training)技术。谷歌在 3.8 版本中将后训练算力与策略大幅向代码能力倾斜,从而实现了单点突破。
五、实测反馈:速度与指令遵循度获好评
近两日的灰度测试显示,用户反馈呈现两极化特点:

▲ 图 10:Gemini 3.8 Flash 模型身份确认与即时问答效果
优势:极速响应与高指令遵循度
- 响应迅捷:生成小游戏、小组件等即时任务流畅高效。
- 严格遵循指令:完全按照用户 Prompt 要求执行,极少出现“自作主张”的情况。

▲ 图 11:用户使用 Gemini 3.8 Flash 提示词一键生成的互动小游戏

▲ 图 12:社区用户称赞其速度飞快且指令遵循能力极强
争议:Token 消耗增加
- 部分开发者反馈,在处理复杂代码或长流程任务时,模型偶有稳定性问题。
- 思维链(CoT)显著变长:同一套评测任务中,3.8 Flash 消耗的 Token 数量约为 3.7 Flash (High 档) 的两倍(1.2 亿 vs 6400 万)。

▲ 图 13:部分开发者对其复杂工程场景下稳定性的讨论

▲ 图 14:关于深度推理档位与长思维链 Token 消耗的对比探讨
针对 Token 消耗增加的问题,谷歌官方建议:若应用场景对算力效率和成本极度敏感,可适当调低推理档位,或继续使用 3.7 Flash。
六、展望:下一代旗舰或将命名为 Gemini 4
随着 Flash 系列的强势表现,市场关注焦点转向跳票许久的 Pro 旗舰版本。消息称,谷歌可能跳过"3.5 Pro"命名,直接将下一代旗舰命名为Gemini 4。
在正统旗舰 Pro 仍在打磨期间,谷歌凭借 Flash 系列先锋上阵,已在部分领域展现出比肩甚至超越友商旗舰的实力。从 3.6 发布时的质疑到 3.8 的强悍表现,谷歌在 AI 领域的竞争力正强势回归。

▲ 图 15:Google Gemini 进化之路

