谷歌 CEO Sundar Pichai 正式官宣 Gemini 4 系列,首发型号为 Gemini 4 Argon。此次发布标志着谷歌在人工智能领域的又一重大突破,其性能与定价策略对 OpenAI 和 Anthropic 构成了强力挑战。
Gemini 4 Argon:内部代号实锤,性能全面领先
此前业内猜测的 Gemini 4 Pro 内部代号“Argon”(氩,一种惰性气体)得到官方证实。从基准测试数据来看,Gemini 4 Argon 的表现极为强劲,多项指标位居行业第一。
在编程基准测试 DeepSWE v1.1 中,Gemini 4 Argon 得分 77.9%,超越 OpenAI 的 GPT-6 Astra(74.1%)以及 Anthropic 的 Claude Opus 5.5(74.2%)和 Claude Fable 5.1(67.4%)。
在综合经济影响力基准 Vals Index(68.9%)和长视频理解 LVBench(91.7%)中,该模型同样斩获第一。尤其在法律测试 Harvey's Legal Agent Benchmark 中,其得分高达 19.6%,远超第二名 Claude Fable 5.1 的 6.7%,展现出碾压级的优势。
当然,在部分编程测试如 FrontierSWE v2 中,Gemini 4 Argon(55.0%)略逊于 GPT-6 Astra(65.5%),但整体实力依然处于第一梯队。
极致性价比:顶级模型对标中杯价格
Gemini 4 Argon 最引人注目的亮点在于其极具竞争力的定价策略。作为与 Astra、Fable 同级别的旗舰模型,其定价却与中杯模型 Sol、Sonnet 持平:
- 输入价格:2 美元/百万 tokens
- 输出价格:10 美元/百万 tokens
相比之下,GPT-6 Astra 的输入价格为 10 美元,输出价格为 50 美元。这意味着 Gemini 4 Argon 的成本仅为竞品的 20%,便宜了 80%。此外,其缓存输入价格低至每百万 tokens 0.1 美元,仅为正常输入价格的 5%。
技术突破:百万级输出 Token 上限
Gemini 4 Argon 将输出 Token 上限提升至 100 万,刷新业界纪录。需要注意的是,这是指单次输出的长度,而非上下文窗口大小。相较于上一代 Gemini 3.1 Pro 的 6.4 万输出上限,这一提升接近 16 倍。
超长输出能力使得模型能够在单轮对话中持续推理,无需拆分任务即可解决复杂问题,极大提升了工作效率和体验。
内部应用成效显著
目前,谷歌内部已大规模部署 Gemini 4 Argon,并在多个关键领域取得显著成果:
- 量子计算:团队利用该模型在几分钟内将基线性能提升 40%。
- 基础设施优化:智能体自主分析全球数据中心性能数据,识别并实施内存优化方案,成功释放 300 TiB 内存。
- 代码迁移:正在将 Fuchsia 操作系统内核超过 80 万行的 C/C++ 代码迁移至 Rust,并为开源视频解码器 libgav1 替换了 3.2 万行 SIMD 代码。生成的 Rust 版本性能比前代移植版提升 2.7 倍。
结语:暂未向公众开放
尽管 Gemini 4 Argon 性能卓越且价格诱人,但目前该模型主要服务于谷歌内部及特定合作伙伴,普通用户暂时无法使用。具体对外开放时间表尚未公布,值得关注后续动态。

