大数跨境

刚刚,Gemini 3.8 Flash 来了,结果惨遭对手嘲讽

刚刚,Gemini 3.8 Flash 来了,结果惨遭对手嘲讽 APPSO
2026-09-03
4
导读:沉迷 Flash 模型,不知天地为何物
谷歌大模型更新节奏显著加速。距离 Gemini 3.7 Flash 发布仅三周,Google 正式推出 Gemini 3.8 Flash 及专攻网络安全的 Gemini 3.8 Flash Cyber。
短短六周内,Gemini Flash 产品线已完成三次大版本迭代。这种高频更新在大模型行业前所未有,标志着谷歌内部开发策略的转变:Agent、强化学习及工具调用等新能力,正优先在体量更小、迭代成本更低的 Flash 系列上落地。
与此同时,Meta 也更新了 Muse Spark 1.3,聚焦 Agent 长任务与编码能力。Meta AI 负责人 Alexandr Wang 更是在新模型发布后调侃道:「我真不想这么说,但是……Gemini 是谁?」

Pro 难产,Flash 被推上了主桌

Gemini 3.8 Flash 被谷歌定位为目前最智能的推理与编程模型之一,重点瞄准端到端自主 Agent 工作流及长周期软件工程任务。官方 Benchmark 显示,该模型正试图摆脱「廉价快速」的固有标签,承担起更复杂的执行任务。
在 DeepSWE v1.1 长周期软件工程测试中,Gemini 3.8 Flash 自主处理复杂端到端工程问题的能力,超越了不少体量更大的前沿模型。
在金融和法律等专业场景,其表现同样提升显著。在 Vals Finance Agent V2、Harvey's Legal Agent Benchmark 等测试中,3.8 Flash 大幅领先上一代;在涵盖 STEM 与人文知识的 HLE-Verified 测试中,得分达到 54.9%。

Agentic loops:从「给答案」到「干完活」

性能提升的核心在于谷歌重点强化的「Agentic loops」。不同于过去生成代码后需用户介入修改的模式,3.8 Flash 具备持续推理、调用工具、检查结果并自我修正的能力。
面对复杂任务,模型可主动增加推理步骤,根据执行结果重新评估方案。用户可通过调整 effort level,在复杂任务完成率与响应速度、成本之间取得平衡。
官方 Demo 显示,仅需简单指令,Gemini 3.8 Flash 即可在 Google Antigravity 中持续调用工具,完成包含谜题、环境叙事及纹理生成的 3D 游戏,甚至能构建具备街景和导航功能的 DOS 版 Google Maps。

速度与质量的博弈

实测数据显示,3.8 Flash 的优势在于极致的速度与低成本,但在最终成品质量上与传统旗舰模型仍有差距。
在 Three.js 物理场景制作测试中,Gemini 3.8 Flash 总成本仅为 0.12 美元,耗时不到 70 秒;而 Claude Opus 5 成本高达 1.86 美元,耗时近 5 分钟。另一项测试中,Flash 仅用 37 秒即可完成 Opus 5 耗时 24 分钟的任务。
然而,在游戏机制、移动表现及高复杂度场景细节上,Flash 的表现略逊一筹。例如在纽约城市场景生成中,3.8 Flash 仅生成了 6 棵树,远少于 Opus 5 的 1840 棵,且忽略了部分明确要求的视觉特效,却添加了许多未请求的功能。
价格方面,Gemini 3.8 Flash 维持优惠价至 2026 年底:输入每百万 Token 0.75 美元,输出每百万 Token 3.75 美元。

Gemini 的新能力,为什么总在 Flash 首发?

此次同步发布的还有专为网络安全设计的 Gemini 3.8 Flash Cyber。该模型通过 Fairwind 计划向审核通过的防御者开放,专注于漏洞发现、渗透测试及安全补丁生成。
在 CyberGym 漏洞发现基准测试中,3.8 Flash Cyber 表现优于上一代及多款大型前沿模型。在覆盖 20 种编程语言的真实代码测试中,其漏洞发现成功率超 70%;在自动修复方面,CWE-Bench Pass@1 得分为 47.2%,接近顶尖水平但成本更低。
Chrome 安全团队内部测试显示,该模型生成的正确补丁数量是部分大型商业模型的 2.6 倍。安全公司 Wiz 的测试表明,使用此模型进行渗透测试可将漏洞召回率提高约 7.5% 至 9.7%,同时成本下降 2.3 至 5.2 倍。谷歌云团队更利用该模型在两小时内定位了一处传统流程需数月才能发现的严重漏洞。

研发策略转向:小步快跑

Flash 系列的频繁更新折射出大模型研发范式的转变。随着单纯扩大模型规模的边际收益递减,强化学习、Agent 训练及后训练技术的重要性日益凸显。
由于 Flash 规模较小,修改和重训练的算力成本低,谷歌得以让多个团队并行尝试不同方案,实现约三周一次的快速迭代。相比之下,Pro 系列因涉及巨额算力和资源协调,试错成本高昂,仅在能力提升显著时才进行更新。
过去一年,谷歌旗舰模型研发遭遇波折,Noam Shazeer、Jeff Dean 等技术核心相继离职,Gemini 3.5 Pro 方案因提升不明显被取消,Gemini 4 仍处后训练阶段。在此背景下,Flash 系列凭借「低成本、快验证」的优势,成为了新技术落地的试验田和主力军。
谷歌已从 OpenAI 招募后训练负责人 Barret Zoph,进一步加大相关投入。当前的策略是:Flash 作为高速开发分支,快速验证并交付 Agent 训练与 RL 新成果;Pro 系列则坚守旗舰定位,等待颠覆性突破。这一切的前提,是备受期待的 Gemini 4 最终能如期交付。
【声明】内容源于网络
0
0
APPSO
AI第一新媒体,「超级个体」的灵感指南。 #AIGC #智能设备 #独特应用 #Generative Al
内容 15711
粉丝 0
APPSO AI第一新媒体,「超级个体」的灵感指南。 #AIGC #智能设备 #独特应用 #Generative Al
总阅读406.8k
粉丝0
内容15.7k