一个精致的 PS5 手柄动画,支持五种微距视角切换及按键动效模拟。令人惊讶的是,这并非视频,而是一张由 AI 在 10 分钟内生成的纯 SVG 矢量图。
该模型在 Arena 平台代码竞技场中显示为Gemini 3.8 Flash,但其展现出的前端生成能力远超 Flash 级别模型的常规范畴,引发了全球开发者的实测热潮。
实测表现:超越预期的前端生成能力
在“鹈鹕骑自行车”的经典 SVG 测试中,新模型生成的作品风格独特,细节完整,质量直逼顶级模型GPT-6 Pro。
在像素风 3D 宝塔测试中,生成的页面不仅包含四种光照模式和六个镜头位置,还支持拖拽旋转及夜景浮灯特效。
此外,新模型仅用 10 分钟便生成了带有五种涂装切换功能的 3D 直升机展示页,座舱、尾桨及线框模型等细节均处理得相当到位。
身份疑云:马甲下的 Gemini 4 Pro
通过对比测试发现,面对“真核动物细胞超微结构图”的提示词,正版Gemini 3.8 Flash仅能生成扁平 2D 示意图,而该神秘模型则输出了教科书级别的 3D 剖面图。结合其卓越的艺术网站设计能力,种种迹象表明,这并非 Flash 系列模型。
综合多方信息推断,这位披着Gemini 3.8 Flash马甲的选手,实为谷歌内部代号为Argon(氩)的Gemini 4 Pro。
背景回顾:从难产到跳跃式升级
谷歌上一代 Pro 级模型仍停留在今年 2 月发布的Gemini 3.1 Pro。曾高调预告的Gemini 3.5 Pro因 Agent 能力未达预期而被取消发布。随后,谷歌连续迭代了 3.6 至 3.8 三个 Flash 版本作为过渡。此次Gemini 4 Pro的直接亮相,标志着谷歌在经历长时间的技术打磨后,试图重新确立其在 AI 领域的领先地位。
核心参数与性能基准
上下文窗口突破
新模型的输出 Token 上限高达 256K,是当前 Gemini 家族最大值(64K)的四倍。在千颗行星 JSON 压力测试中,该模型展现了极强的长文本生成稳定性。
后台动态调整
观察发现,该模型在 Arena 平台的标识曾在数小时内从gemini-3.8-flash变更为gemini-3.7-flash,暗示谷歌正在进行后台模型的动态调试与替换。
基准测试数据
据流传的基准测试表显示(尚未独立验证),Gemini 4 Pro在多项关键指标上表现优异:
- 长周期软件工程测试(DeepSWE):88.7%(超越 GPT-6 Astra 的 86.9%)
- 多学科推理(HLE):72.1%(超越 67.3%)
- 桌面自动化(OSWorld):86.8%(超越 84.5%)
极具竞争力的定价
若数据属实,Gemini 4 Pro的定价策略极具颠覆性:输入 2.25 美元/百万 Tokens,输出 11.25 美元/百万 Tokens。相比之下,同级别的GPT-6 Astra定价高达输入 12 美元、输出 60 美元。
尽管部分测试图表存在伪造可能,但Gemini 4 Pro所展现出的技术潜力不容忽视。谷歌能否凭借此模型重回“御三家”巅峰,答案将在 10 月揭晓。

