大数跨境

谷歌杀疯了!Gemini 3.8 Flash 突袭发布:代码打平 Opus 5,成本仅需 1/5

谷歌杀疯了!Gemini 3.8 Flash 突袭发布:代码打平 Opus 5,成本仅需 1/5 MaynorAI
2026-09-03
5
导读:Gemini 国内快速体验途径:https://trygpt.asia/list/#/home

谷歌发布 Gemini 3.8 Flash:代码能力比肩顶级旗舰,成本仅需五分之一

谷歌正式推出全新轻量级旗舰模型 Gemini 3.8 Flash。该模型在性能上实现显著突破,同时定价策略极具竞争力:当前维持原价并享受首发半价优惠。

价格对比一览

阶段 / 时间节点 每百万 Token 输入价格 (Input) 每百万 Token 输出价格 (Output) 状态
首发限时优惠(当前) $0.75 美元 $3.75 美元 现已上线
2027 年起(恢复原价) $1.50 美元 $7.50 美元 预计恢复

▲ 图 1:Google 官方控制台中已支持选择 Gemini 3.8 Flash 系列模型

一、研发节奏加速:六周连发三款 Flash 模型

谷歌近期展现出惊人的研发与发布效率,在短短 6 周内连续推出了三款 Flash 系列模型:

  • 7 月 21 日:Gemini 3.6 Flash
  • 8 月 13 日:Gemini 3.7 Flash
  • 今日:Gemini 3.8 Flash

平均两周迭代一代模型的频率,给整个 AI 行业带来了前所未有的竞争压力。

▲ 图 2:谷歌 CEO Sundar Pichai 亲自发文宣布 Gemini 3.8 Flash 上线

二、性能评测:轻量模型对标顶级旗舰

此次官方评测将参照标准大幅提升,Gemini 3.8 Flash 直接对标 Claude Opus 5 与 GPT-5.6 Sol 等头部厂商的顶配超大旗舰模型。

▲ 图 3:Gemini 3.8 Flash 与 GPT-5.6 Sol、Claude Opus 5 的全方位跑分对比

1. 编程能力:与 Claude Opus 5 持平

在代码生成与解决真实工程问题方面,Gemini 3.8 Flash 表现优异,与 Claude Opus 5 几乎战平:

  • DeepSWE:73.7% vs 74.0%
  • Terminal-bench 2.1:89.4% vs 89.1%

在知名数据公司 Datacurve 构建的第三方编程基准 DeepSWE(涵盖 91 个真实开源仓库的 113 道硬核代码修补任务)测试中,Gemini 3.8 Flash 与 Opus 5 的通过率均为 74%,并列全球第一。

▲ 图 4:第三方机构 Datacurve 的 DeepSWE 代码基准测试榜单

2. 极致性价比:性能相当,成本仅为旗舰 1/5

虽然两者得分同为 74%,但成本差异巨大:

评估模型 DeepSWE 任务通过率 平均单题消耗成本 综合成本倍数
Gemini 3.8 Flash 74% $2.36 美元 基准 (1x)
Claude Opus 5 74% $11.84 美元 贵 5 倍 (5x)

在“得分 - 成本”性价比象限图中,Gemini 3.8 Flash 位居右上角最顶端,被官方标注为"Most Efficient"(全场最高效)。即便是主打性价比的 GLM-5.3,其效率也低于该模型。

▲ 图 5:各大主流模型在 DeepSWE 榜单上的性价比象限图

短短 4 个月,谷歌将 Flash 系列在 DeepSWE 上的通过率从 3.5 时代的 35% 提升至 3.8 的 74%,且在追平顶级旗舰的同时,单题调用成本基本保持不变。

3. 垂直领域 Agent 能力反超

在金融 Agent(Finance Agent)和法律 Agent(Legal Agent)两项专业垂直领域测试中,Gemini 3.8 Flash 的表现甚至超越了同台竞技的旗舰大模型。

▲ 图 6:Gemini 3.8 Flash 在金融与法律垂直领域 Agent 评测中的领先表现

三、客观分析:模型存在的局限性

尽管在代码与垂直任务上表现突出,Gemini 3.8 Flash 并非全能模型,仍存在以下短板:

▲ 图 7:Terminal-bench 多版本跑分及细分能力对比

1. 超长程复杂任务处理能力不足

在评估长流程、多步骤复合任务能力的 Terminal-bench 4.0 榜单上:

  • Claude Opus 5:得分 51.8%
  • Gemini 3.8 Flash:得分 19.1%

面对极度复杂的连续长任务时,Flash 模型在深度推理与长程规划能力上与顶级旗舰仍有明显差距。

▲ 图 8:技术社区关于 Terminal-bench 4.0 长程任务表现差距的讨论

2. 综合泛化智力属第二梯队

在权威评测机构 Artificial Analysis 的模型综合智力榜单上:

  • Gemini 3.8 Flash:综合得分 59 分,位列第 8;
  • 整体水平与 Kimi K3、GLM-5.3 处于同一档位,略低于 GPT-5.6 Sol(差 2 分)。

▲ 图 9:Artificial Analysis 全球大模型综合智力排行榜

四、技术解析:基于后训练技术的突破

综合排名第八却能在单项代码能力上跻身全球前二,其技术路径如下:

  • 底座未变:Gemini 3.8 Flash 是在 3.7 Flash 基础上继续训练而成,3.6 和 3.7 同样基于同一底座。
  • 知识截止未更新:历代模型卡的知识截止日期均停留在 2025 年 1 月,表明期间未进行大规模重新预训练。

这三代 Flash 的性能飞跃完全依赖后训练(Post-training)技术。谷歌在 3.8 版本中将后训练算力与策略大幅向代码能力倾斜,从而实现了单点突破。

五、实测反馈:速度与指令遵循度获好评

近两日的灰度测试显示,用户反馈呈现两极化特点:

▲ 图 10:Gemini 3.8 Flash 模型身份确认与即时问答效果

优势:极速响应与高指令遵循度

  • 响应迅捷:生成小游戏、小组件等即时任务流畅高效。
  • 严格遵循指令:完全按照用户 Prompt 要求执行,极少出现“自作主张”的情况。

▲ 图 11:用户使用 Gemini 3.8 Flash 提示词一键生成的互动小游戏

▲ 图 12:社区用户称赞其速度飞快且指令遵循能力极强

争议:Token 消耗增加

  • 部分开发者反馈,在处理复杂代码或长流程任务时,模型偶有稳定性问题。
  • 思维链(CoT)显著变长:同一套评测任务中,3.8 Flash 消耗的 Token 数量约为 3.7 Flash (High 档) 的两倍(1.2 亿 vs 6400 万)。

▲ 图 13:部分开发者对其复杂工程场景下稳定性的讨论

▲ 图 14:关于深度推理档位与长思维链 Token 消耗的对比探讨

针对 Token 消耗增加的问题,谷歌官方建议:若应用场景对算力效率和成本极度敏感,可适当调低推理档位,或继续使用 3.7 Flash。

六、展望:下一代旗舰或将命名为 Gemini 4

随着 Flash 系列的强势表现,市场关注焦点转向跳票许久的 Pro 旗舰版本。消息称,谷歌可能跳过"3.5 Pro"命名,直接将下一代旗舰命名为Gemini 4

在正统旗舰 Pro 仍在打磨期间,谷歌凭借 Flash 系列先锋上阵,已在部分领域展现出比肩甚至超越友商旗舰的实力。从 3.6 发布时的质疑到 3.8 的强悍表现,谷歌在 AI 领域的竞争力正强势回归。

▲ 图 15:Google Gemini 进化之路

【声明】内容源于网络
0
0
MaynorAI
1234
内容 186
粉丝 0
MaynorAI 1234
总阅读5.1k
粉丝0
内容186