
Gemini 4 系列终于亮相,但普通用户尚无法直接使用。
当地时间 9 月 30 日,Google 正式发布 Gemini 4 Argon。这是 Gemini 4 系列的首款旗舰模型,也是自 2025 年 11 月推出 Gemini 3 系列以来,Google 在旗舰模型层面的首次重大更新。在此期间,Google 主要聚焦于 Flash 系列的迭代,Argon 的发布标志着其重新回归前沿能力竞争。
目前,Argon 尚未向公众开放,而是通过受控早期访问项目 Fairwind,优先提供给受信任的网络安全防御机构进行测试。Google 表示,待安全护栏进一步完善后,将逐步向开发者、企业和普通消费者开放。
定位企业级复杂工作流,输出能力提升显著
Argon 被定位为面向复杂、长流程工作流的旗舰模型,重点覆盖软件工程、法律、金融等企业知识工作及网络安全防御领域。
相比上一代,Argon 的单次输出上限从 6.4 万 token 大幅提升至 100 万 token。这一突破使得模型能够在单次任务中生成更长的推理和执行轨迹,减少人工干预,从而更高效地处理需要持续分析、反复验证及长链条执行的复杂问题。
目前,Google 内部已有数千名员工使用 Argon 进行专项编程、深度研究和写作。在实际应用中,Argon 展现了强大的优化能力:
- 量子计算优化:在量子计算团队测试中,Argon 在数分钟内找到新的优化方案,使计算成本(qubits 与 gates 乘积)较基线结果降低 40%。
- 数据中心内存优化:通过分析性能遥测数据并自动执行内存优化,预计最终可节省 500 TiB 至 1 PiB 内存,目前已释放超过 300 TiB。
- 代码迁移重构:在 Google 大规模 C/C++ 向 Rust 迁移工作中,Argon 协助完成了包括 re2、libgav1 及 Fuchsia Zircon 内核在内的超 80 万行代码迁移。其中,在 libgav1 视频解码器项目中,Argon 重写了约 3.2 万行 SIMD 代码,在保持视频输出一致的前提下,性能较原 Rust 版本提升 2.7 倍,接近优化后的 C++ 实现,同时具备内存安全优势。
多项基准测试领先,综合实力强劲
在企业任务评测中,Argon 表现优异。在衡量真实长流程软件工程任务的 DeepSWE v1.1 上得分为 77.9%;在覆盖金融、编程、法律和税务等领域的 Vals Index 中处于领先地位。
具体细分领域表现如下:
- 金融研究:在 Vals Finance Agent v2 基准中保持领先。
- 法律智能:在 Harvey 法律智能体基准中得分为 19.6%,远超 GPT-6 Astra(5.4%)和 Claude Opus 5.5(3.8%)。
- 自动化流程:在 Zapier AutomationBench 上得分为 51.3%,高于 Claude Opus 5.5(42.5%)和 GPT-6 Astra(41.4%)。
- 多模态理解:在长视频理解基准 LVBench 上得分为 91.7%。
在 Google 公布的 18 项评测对比中,Argon 单独领先 12 项,并列第一 1 项;GPT-6 Astra 单独领先 3 项,并列 1 项;Claude Opus 5.5 单独领先 2 项。尽管 Argon 在 FrontierSWE v2 和 Terminal-Bench Science 0.1 等特定任务上略逊于竞品,但其优势在于软件工程、企业知识工作、自动化和多模态理解等多个维度的均衡且强劲的表现。
(来源:Google)
强化网络安全能力,漏洞修复效率提升
网络安全是 Argon 重点强化的方向。Google 表示,Argon 已具备自主发现、验证和修复漏洞的能力。针对经过审核的安全防御机构及内部团队,Google 提供不受部分安全护栏限制的版本,以充分发挥其防御潜力。
Google 旗下云与 AI 安全平台 Wiz 已将 Argon 应用于“Scan for Good”项目,为关键公共基础设施提供免费安全扫描。早期演示显示,Argon 成功识别出全球多家医院使用的某医疗软件中存在的一个严重漏洞,该漏洞此前未被其他前沿模型发现。
在基准测试方面:
- CWE-bench v1:Argon 以 68% 的成绩并列第一,延续了 Google 在漏洞修复领域的领先优势。
- 综合漏洞基准:在对覆盖 20 种编程语言的复杂代码库分析中,Argon 有效识别出多类安全暴露问题。
- 黑盒渗透测试:在 Wiz 内部基准测试中,Argon 在攻击面发现、漏洞识别及概念验证生成等环节均优于前代模型 3.8 Flash Cyber。
定价策略极具竞争力,分阶段推进开放
价格方面,Google 为 Argon 设置了早期优惠价格:每百万输入 token 2 美元,输出 token 10 美元,缓存输入享受 95% 折扣。相比之下,OpenAI GPT-6 Astra 公开价格为输入 10 美元/输出 50 美元,Anthropic Claude Opus 5.5 为输入 4 美元/输出 20 美元。
早期优惠结束后,Argon 标准定价将调整为输入 4 美元/输出 20 美元,与 Claude Opus 5.5 持平,但仍显著低于 GPT-6 Astra。
为确保安全,Google 将在全面开放前继续加强模型护栏,平衡恶意使用限制与合法双用途场景(如网络安全、科学研究)的需求。为此,Google 部署了运行时缓解机制,监控模型的思维链和实际动作,必要时中止任务执行,并将异常行为警报发送至事件响应团队,同时避免将监控结果直接反馈至训练过程以防模型规避监管。
(来源:Google)
战略调整后的关键一步,商业化落地待观察
Argon 的发布正值 Google AI 组织经历重大调整之际。2026 年 8 月,Demis Hassabis 卸任 Google DeepMind CEO 转任 Alphabet 董事长兼首席科学家,Koray Kavukcuoglu 接任 DeepMind 负责人并向 Sundar Pichai 汇报。尽管 Google 未将组织变动与发布时间直接关联,但外界普遍认为,Argon 的推出回应了关于资源分配及旗舰模型竞争力的关注。
按照计划,Argon 将逐步向付费 API 客户和 Google AI Ultra 订阅者开放。对于企业用户而言,除了基准测试成绩,正式定价、速率限制、数据治理政策以及与 Gemini API、Vertex AI、Google Cloud 等生态系统的整合程度,将是决定其商业化成功的关键因素。
总体而言,Gemini 4 Argon 明确展示了 Google 的战略重心:相较于消费级聊天体验,更侧重于证明旗舰模型在软件工程、网络安全及受监管知识工作中执行复杂任务的能力。纸面优势能否转化为生产环境中的稳定表现,仍有待市场检验。
参考资料:
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/
https://www.axios.com/2026/09/30/google-gemini-4

