谷歌 Gemini 3.8 Flash 发布:性能逆袭与价格优势
作为 Transformer 的发明者与全球科技巨头,谷歌在 AI 大模型领域底蕴深厚。继过去四个月连续发布四款 Flash 系列模型后,谷歌于几小时前正式推出 Gemini 3.8 Flash。此次更新距离上一代 Gemini 3.7 Flash 仅三周,距离 3.6 版本六周。新模型维持原有 API 定价策略,输入每百万 tokens 0.75 美元,输出 3.75 美元。同期发布的还有专为安全机构定制的 Gemini 3.8 Flash Cyber 版本,暂未向普通用户开放。
基准测试表现:特定领域超越旗舰模型
尽管定位为轻量级 Flash 模型,Gemini 3.8 Flash 在多项基准测试中表现亮眼,甚至对标 Claude Opus 5 与 GPT-5.6 Sol 等旗舰模型。
在考察独立软件工程能力的 DeepSWE v1.1 测试中,Gemini 3.8 Flash 得分 73.7%,略高于 GPT-5.6 Sol,仅次于 Claude Opus 5 的 74.0%。此外,该模型在金融智能体测试(Vals Finance Agent v2)中以 61.4% 的得分位居榜首,超越 Claude Opus 5 的 58.6%;在法律智能体测试(Harvey Legal Agent Benchmark)中同样排名第一,得分为 10.0%。在多学科专家推理(HLE-Verified)测试中,三家主流模型得分相近,均在 54% 左右。
谷歌特意在对比表中强调了价格优势:Claude Opus 5 的输入输出价格分别为 5 美元和 25 美元,而 Gemini 3.8 Flash 仅为 0.75 美元和 3.75 美元,成本相差约 7 倍,且在金融与法律垂直赛道表现更优。
能力局限:复杂任务仍有差距
然而,受限于 Flash 定位,该模型在复杂编程与综合知识工作上与顶级模型仍存在显著差距。在 Terminal-bench 4.0 终端编程测试中,Gemini 3.8 Flash 准确率仅为 19.1%,远低于 Claude Opus 5 的 51.8%。在知识工作综合评分(GDPVal-AA v2)与计算机操控(OSWorld 2.0)测试中,其得分也明显落后于竞争对手。数据显示,Gemini 3.8 Flash 呈现出明显的“偏科”特征。
在 Artificial Analysis 最新排行榜中,该模型综合智商得分为 59 分,较前代提升 3 分,已跻身中型模型前列。
速度与伦理争议:高吞吐背后的 Token 消耗
Gemini 3.8 Flash 的最大亮点在于其惊人的输出速度,达到每秒 305 个 token,远超 Meta Muse Spark 1.2(154 tokens/s)及 Claude 系列模型。但开发者指出,完成同等任务时,新模型消耗的 Token 数量约为 3.7 Flash 的两倍,更是 Claude Opus 5 的四倍。谷歌官方回应称,模型在复杂任务中增加了推理步骤与工具调用频率,通过延长“思考时间”来提升表现,而非单纯的能力跃升。
市场反馈:赞誉与质疑并存
社区对 Gemini 3.8 Flash 的评价呈现两极分化。部分开发者赞赏其速度快、编程体验流畅,认为其在去除广告干扰的信息检索方面表现出色。然而,质疑声音同样强烈,不少技术人员指出该系列模型存在明显的“刷榜”嫌疑,幻觉问题依旧存在,且在长上下文处理能力上表现不佳。有观点认为 DeepSWE 等基准测试可能已被过度优化,导致新模型频繁屠榜的现象存疑。
总体而言,Gemini Flash 系列凭借极高的性价比和特定的场景优势,已成为市场上不可忽视的力量。结合谷歌近期推出的学生认证优惠活动,其市场竞争力进一步增强。

