大数跨境

刚刚,谷歌Gemini 4 Argon杀回前三!追平GPT-6 Astra,Token价只要1/5

刚刚,谷歌Gemini 4 Argon杀回前三!追平GPT-6 Astra,Token价只要1/5 新智元
2026-10-01
10

谷歌发布Gemini 4 Argon:智能追平GPT-6,主打高性价比与低幻觉

新智元报道

沉寂7个月后,Google DeepMind于北京时间10月1日凌晨正式发布Gemini 4 Argon。这是其近半年来首款非Flash级专有模型,旨在通过极高的性价比和较低的幻觉率,重新确立在前沿大模型市场的竞争力。

在Artificial Analysis的智能指数评测中,Gemini 4 Argon获得53分,与GPT-6 Astra及Fable 5.1持平,略高于GPT-6.1 Sol。其显著优势在于将幻觉率降至15%,并在Agent能力及网络安全基准测试中表现优异。

目前,该模型已向选定用户开放,支持1M上下文窗口及多模态输入。凭借极具侵略性的首发定价,Argon直接冲击了当前大模型的价格战格局。

价格透视:单价极低但用量大,长期成本需精算

虽然智能分数追平竞品且账单看似更薄,但深入分析发现,Gemini 4 Argon采取了“低单价、高用量”的策略。促销期结束后,其实际任务成本可能反超部分竞争对手。

重回第一梯队,定价策略激进

Gemini 4 Argon是谷歌超过7个月来推出的首款高于Flash级别的闭源模型。其在智能指数上比上一代非Flash模型Gemini 3.1 Pro Preview高出23分,标志着谷歌重回全球顶尖AI实验室行列。

为吸引用户,谷歌制定了极具诚意的首发价格:

  • 输入Token:每百万2美元(约为Opus 5.5的一半,Astra的1/5);
  • 输出Token:每百万10美元(同为Opus 5.5的一半,Astra的1/5);
  • 缓存折扣:符合缓存条件的输入享受95%折扣,折后每百万仅需0.10美元。

隐性成本:推理过程冗长导致总账单增加

尽管单价低廉,但Argon的平均单次任务输出量高达6.2万Token,远超Astra的2.7万Token。这意味着虽然“纸张便宜”,但“草稿”写得更多。

在智能指数测试平均任务成本中:

  • Gemini 4 Argon:1.99美元(低于Astra的3.26美元、Opus 5.5的5.98美元);
  • GPT-6.1 Sol:仅0.72美元(Argon约为其2.7倍)。

需注意,上述价格为首发5折促销价。若恢复标准价(输入4美元/百万,输出20美元/百万),Argon的单任务成本将升至3.98美元,约为Astra的1.2倍。因此,企业用户在长期接入前,需结合自身任务的输入长度、输出需求及缓存利用率进行详细测算。

能力评测:低幻觉率与强大的Agent执行力

克制即智慧:幻觉率行业最低

在AA-Omniscience测试中,Gemini 4 Argon的幻觉率仅为15%,是智能指数45分以上模型中最低的(Astra为51%,Sol为54%)。这得益于模型更倾向于承认“不知道”,而非强行生成错误答案。

然而,低幻觉率并未完全转化为高准确率。Argon在该测试中的准确率为50%,低于Astra的63%。综合来看,Argon在“少犯错”方面表现卓越,但在“答对题”的数量上仍有提升空间。

Agent能力:自动化与安全领域表现突出

在实际执行任务方面,Argon呈现出差异化优势:

  • 自动化基准:在AutomationBench-AA中以77.5%的成绩位列第一;但在Terminal Bench 4中得分为57%,落后于Sonnet 5.5、Opus 5.5和Astra。
  • 任务完成度:在AA-Briefcase测试中,满足评分细则的比例高达65%,但分析与呈现质量偏低,显示其在“按要求交活”与“高质量交付”之间仍有差距。
  • 网络安全:在CWE-bench v1中并列第一(68%),具备自主发现、验证漏洞并生成PoC(概念验证)的能力。
  • 文本处理:在Text Arena中排名第一。

实战应用:已介入谷歌核心基础设施优化

相比榜单数据,Gemini 4 Argon在谷歌内部的实际应用更具说服力。目前,该模型已深入参与数据中心性能优化及代码迁移工作。

数据中心内存优化

Argon智能体通过分析数据中心性能数据,识别出内存优化点并实施改动,最终释放了超过300 TiB的内存资源。这一案例证明了模型在处理复杂系统工程问题上的实际价值。

代码迁移与性能提升

  • C/C++转Rust:Argon正参与超过80万行内核代码向Rust语言的迁移工作,目前处于审计和测试阶段。
  • 视频解码器优化:智能体使用安全Rust替换了3.2万行SIMD代码。结果显示,新版代码运行速度提升2.7倍,且视频输出保持一致,满足了严格的工程效率要求。

超长上下文与断点续传

Gemini 4 Argon支持1M Token上下文,可处理文字、图片、视频和语音。针对长任务易超时的问题,Gemini API新增“Long Decode Continuation”功能,允许长回复暂停并通过后续调用继续输出,理论上支持长达1M输出Token的推理过程,为复杂工程任务提供了技术保障。

随着OpenAI、Anthropic和谷歌形成三方抗衡局面,用户在选择模型时不仅关注分数和价格,更看重具体的工程落地成果。Gemini 4 Argon通过降低幻觉率和展示内部基建优化成果,展示了其在长期使用中的潜力。然而,促销期后的真实成本效益,仍需用户根据自身业务场景仔细评估。

参考资料:

https://x.com/ArtificialAnlys/status/2105392625788637299
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/
https://x.com/sundarpichai/status/2105387952478277979

编辑:Aeneas 大卫

【声明】内容源于网络
0
0
新智元
智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
内容 16581
粉丝 0
新智元 智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
总阅读428.1k
粉丝0
内容16.6k