大数跨境

谷歌终于支棱起来了?Gemini 4 Pro疑空降Arena榜单,13项跑分碾压GPT-6和Fable

谷歌终于支棱起来了?Gemini 4 Pro疑空降Arena榜单,13项跑分碾压GPT-6和Fable AI前线
2026-09-18
5
导读:13项跑分全面碾压GPT-6和Fable,成本近五分之一
作者 | 四月

谷歌在大模型领域的竞争格局中迎来关键转折。在 GPT-6(Astra)与 Claude Fable 相继主导代码、Agent 及长程任务赛道之际,谷歌终于结束长达七个月的旗舰模型空窗期,直接跳过 Gemini 3.x 系列迭代,于 9 月 18 日悄然上线 Gemini 4 Pro(内部代号"Argon")。实测数据显示,该模型在多项核心基准测试中全面超越竞品,且具备极高的性价比优势。

13 项全能碾压 Astra 和 Fable

尽管谷歌尚未官方确认,但 Arena 匿名盲测榜单及社区测试者(如 LuminaBench、Harshith 等)的数据指向明确:代号为"gemini-3.8-flash"的匿名模型实为 Gemini 4 Pro 的早期版本。该模型在列出的 13 组权威测试中均取得最高成绩,对手涵盖 GPT-6 Astra、Claude Fable 5.1 等顶尖模型。

核心基准测试表现

  • Coding 能力:在 DeepSWE v1.1 测试中得分为 88.7%,超越 Astra 的 86.9%;
  • 知识工作:GDPval-AA v2 得分高达 2064 Elo,显著高于 Astra 的 1994;
  • 多学科推理:HLE 测试达到 72.1%,领先对手近 5 个百分点。

长程 Agent 任务优势显著

随着任务复杂度与链路的增加,Gemini 4 Pro 的优势进一步放大。在 Terminal-Bench 4.0 等高难度长程执行测试中,其表现远超自家 Flash 版本(差距达 13.9 个百分点),并在 OSWorld 2.0 中达到 86.8% 的通过率。这表明该模型在维持长上下文、自主规划多步动作及状态读取方面取得了突破性进展,有效解决了当前 Agent 技术“难以持续串联复杂工作”的痛点。

近五分之一的价格

相比性能提升,Gemini 4 Pro 的定价策略更具冲击力。流出数据显示,其输入价格为每百万 Token 2.25 美元,输出为 11.25 美元。相比之下,Astra 的对应价格分别为 12 美元和 60 美元。这意味着谷歌以约五分之一的成本提供了更强大的旗舰模型能力。

若此价格策略正式落地,将迫使行业竞争焦点从单纯的“最强模型”转向“最具规模化效益的 Agent 基础设施”,可能引发新一轮大模型价格战。需注意的是,部分测试数据口径与公开 Leaderboard 存在差异,具体参数仍需等待官方最终确认。

实测惊艳:从网页设计到 3D 交互

社区开发者的密集测试进一步验证了 Gemini 4 Pro 的多模态生成能力,尤其在视觉设计与代码结合的复杂任务上表现优异。

网页设计与 SVG 生成

在网页构建测试中,模型仅用 14 分钟即可完成从结构搭建、视觉风格定义到交互效果实现的全流程,生成的网站被评价为“干净、精致”,彻底改善了以往模型在设计审美上的短板。此外,在“鹈鹕骑自行车”的 SVG 动态场景生成任务中,模型精准处理了代码逻辑、空间关系与视觉构图,成品完整度远超公开版 Gemini 3.8 Flash。

3D 交互与持续规划

测试还展示了模型在 3D 领域的潜力。在 Voxel Pagoda 测试中,Gemini 4 Pro 耗时约 5 分钟搭建出可交互的像素风 3D 宝塔;而在 PS5 SVG 测试中,模型连续运行 10 分钟,展现了卓越的持续规划能力,能够一次性完成高细节度的复杂成品生成。

更多评测案例可在相关技术社区查看。

声明:本文为 AI 前线原创,不代表平台观点,也不构成投资建议,未经许可禁止转载。

【声明】内容源于网络
0
0
AI前线
面向AI爱好者、开发者和科学家,提供大模型最新资讯、AI技术分享干货、一线业界实践案例,助你全面拥抱AIGC。
内容 8718
粉丝 0
AI前线 面向AI爱好者、开发者和科学家,提供大模型最新资讯、AI技术分享干货、一线业界实践案例,助你全面拥抱AIGC。
总阅读216.8k
粉丝0
内容8.7k