大数跨境

突发!Gemini 3.8登顶,谷歌迈出RSI一大步

突发!Gemini 3.8登顶,谷歌迈出RSI一大步 新智元
2026-09-03
4

新智元报道

谷歌正式回归,今夜发布 Gemini 3.8 Flash 及其网络安全专用版 Gemini 3.8 Flash Cyber。这是谷歌六周内推出的第三款 Flash 模型,此次更新将性价比推向极致:单任务成本低至 0.58 美元,输入价格仅为 0.75 美元/百万 Tokens。

这款“白菜价”小模型在多项核心基准测试中,性能已逼近全球最强旗舰 Opus 5、GPT-5.6 Sol 及 Grok 4.6。DeepMind 专家姚顺宇评价称,这对 RSI 而言是一次巨大飞跃。开发者社区反响热烈,普遍认为该模型以 Flash 的价格提供了 Pro 级的性能。

谷歌「卷王」归来:重塑性价比之王

谷歌以极具竞争力的策略宣告回归。在当前 AI 市场格局中,顶级智力通常伴随高昂的 Token 成本,但 Gemini 3.8 Flash 打破了这一壁垒。

在 Artificial Analysis 高推理模式测试中,Gemini 3.8 Flash 智力指数飙升至 59 分,距离 GPT-5.6 Sol 和 Grok 4.6 仅一步之遥,部分维度甚至超越 Claude Opus 5。

实现这一性能的代价极低:单任务成本 0.58 美元(输入 0.75 美元/百万 Tokens,输出 3.75 美元/百万 Tokens)。在智力与成本的帕累托前沿图上,Gemini 3.8 Flash 在软件工程基准 DeepSWE 中遥遥领先。

该模型生成速度高达 305 tokens/s,是次档模型的两倍。在长周期软件工程基准(DeepSWE v1.1)中,其得分达 73.7%,不仅超越众多昂贵大模型,成本仅为后者零头。实测显示,谷歌内部工程师在代码工具 Jetski 中已更倾向于使用 3.8 Flash 而非 Anthropic 的 Opus 模型。

这一跃升源于谷歌在强化学习上的重金投入。由 DeepMind CTO 领导、谢尔盖·布林监督的代码突击队,致力于将编程模型改造为全自动 AI 研究员。谷歌内部备忘录明确指出,目标是弥合智能体执行差距,让模型成为主力开发者。此外,谷歌挖角 Thinking Machines Lab 联合创始人 Barret Zoph 主管强化学习,新任 CEO Koray Kavukcuoglu 亦强调提速战略。

为了赢得最后的冲刺,我们必须紧急弥合智能体执行方面的差距,把我们的模型变成主力开发者。

基准「注水」还是实力超群?

尽管赞誉有加,业界对谷歌的领先姿态仍存质疑。Meta 首席 AI 官 Alexandr Wang 指出,Meta 的 Muse Spark 1.3 在智能指数上得分更高且成本更低,认为 Gemini 在此指标上并无优势。

分析指出,Gemini 3.8 Flash 在 Terminal-Bench 2.1 等特定测试中表现优异,但在面对未见过的真实世界 Zero-shot 挑战时,可能仍不及参数量更大的 Opus 5。然而,谷歌的策略是“勤能补拙”:通过极低的单价,允许模型在执行复杂任务时进行多次迭代推理和自我验证。即便消耗更多 Token,总成本依然远低于调用一次顶级大模型。这种策略证明了在 Agent 循环中,速度与低成本本身即构成强大的智力。

为何主推 Flash?被「毙掉」的 Pro 版

Gemini 3.5 Pro 迟迟未发,并非技术储备不足,而是内部筛选结果严格。据报道,多个 3.5 Pro 候选模型因未能比现有 Flash 系列展现出足够大的性能优势而被取消。下一代旗舰 Gemini 4 虽预训练数据亮眼,但仍卡在后训练阶段。这一系列阴差阳错,造就了 Flash 系列的疯狂迭代与高性价比路线。

2 小时挖掘数月漏洞:网络安全版屠榜

此次发布的另一重磅产品是 Gemini 3.8 Flash Cyber,专为对抗 AI 黑客而生。在 CyberGym 漏洞发现基准测试中,该模型得分 86.2%,大幅领先其他大模型。

在横跨 20 种编程语言的内部测试中,其漏洞发现成功率超 70%。实战数据显示,Chrome 安全团队利用该模型生成的正确修复补丁数量是此前最佳商业模型的 2.6 倍;Wiz 安全公司测试发现其渗透测试召回率提升显著且成本大幅降低。最令人瞩目的是,谷歌云漏洞研究团队利用该模型在 2 小时内发现了一个关键基础漏洞,而人类专家通常需耗时数月。

鉴于其强大的网络攻防能力,谷歌未完全开源该模型,而是通过 Fairwind 计划仅向受信任机构开放。

大模型三国杀:进入分水岭

Gemini 3.8 Flash 的发布标志着 AI 三巨头进化路线的分野:

Anthropic:死磕知识可靠性与稳定

Claude 系列在知识覆盖和事实准确率测试中占据主导,前七名均为其系模型,重点强化企业级任务的稳定性。

OpenAI:押注深度推理与顿悟

GPT 系列在物理、数学推导测试中断崖式领先,追求模型在无监督下的纯粹智力涌现。

Google:打造超高速打工人

谷歌选择了一条不同路径:以极快的反应速度和极低的成本,通过高频次的试错、工具调用和动态调整,在长程工作流中暴力迭代出正确结果。Gemini 3.8 Flash 正是为这种 Agent 时代量身定制的模型,它能以几杯咖啡的成本完成过去需数万美金的任务。

Gemini 3.8 Flash 的出现,标志着大模型正从“巨头专属”走向算力普惠,属于普通开发者的超级个体时代已然来临。

参考资料:

Google Official Blog: Gemini 3.8 Flash and 3.8 Flash Cyber

编辑:Aeneas 大卫

【声明】内容源于网络
0
0
新智元
智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
内容 16515
粉丝 0
新智元 智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
总阅读377.3k
粉丝0
内容16.5k