作者:
Koray Kavukcuoglu,Google DeepMind 高级副总裁兼 Google 首席 AI 架构师
Google 今日正式发布前沿 AI 模型 Gemini 4 Argon。目前,该模型正通过“Fairwind 计划”向部分网络安全专家开放试用。Argon 专为处理复杂长流程任务中的深度推理而设计,已显著改变 Google 内部的工作与开发模式,并在软件工程、法律金融等企业知识工作及网络安全防御领域展现出顶尖性能。
为确保安全,前沿技术的发布将分阶段进行。Google 正积极参与美国政府的模型发布前自愿评估流程,并逐步放开访问权限。在全面面向开发者、企业和用户开放前,公司将持续收集早期测试反馈,完善安全防护机制。
Argon 首发优惠价为:输入 token 每百万个 2 美元,输出 token 每百万个 10 美元;缓存输入 token 可享受 95% 的价格折扣。
Gemini 4 Argon 已全面支持 Google 内部工作流。数千名员工反馈显示,该模型在专业代码编写、深度研究及写作质量方面表现卓越,不仅加速了开发进度,更在多项技术突破中发挥关键作用:
以开源视频解码软件 libgav1 为例,Argon Agent 基于现有 Rust 版本,通过多轮性能引导分析与编译器输出研究,生成了可自动向量化的安全 Rust 代码,成功替换 3.2 万行 SIMD 代码。最终打造的内存安全视频解码器,运行速度比原 Rust 版本快 2.7 倍,性能逼近高度优化的 C++ 版本。
为应对更长、更复杂的使用场景,Gemini 4 Argon 的输出 token 上限大幅提升至行业领先的 100 万(此前为 6.4 万)。充足的生成空间使模型能展开深度思考,在单次推演中生成数十万 token,从而显著提升推理深度,一步到位解决硬核难题。
Gemini 4 Argon 具备出色的代码编写、逻辑推理和多模态能力,以及处理长流程、多步骤任务的持续执行力,使其在企业工作流中表现优异。
Google 工程师已将 Argon 融入日常,用于代码调试、大规模代码库迁移及算法设计等任务。在衡量真实世界长周期软件工程任务的 DeepSWE v1.1 基准测试中,Argon 以 77.9% 的得分刷新行业纪录。
此外,Argon 在 Vals 指数(衡量金融、编码、法律和税务工作的经济影响)中名列前茅,并在 Vals Finance Agent v2 和 Harvey’s Legal Agent Benchmark 等特定领域评估中表现领先。在 Zapier 的 AutomationBench 基准测试中,Argon 以 51.3% 的得分位居榜首,展现了强大的端到端业务功能执行力。
在视觉理解方面,Argon 能进行专业图表分析、长视频细节识别及基于文档采取行动。在 LVBench 长视频理解测试中,其得分高达 91.7%。
为应对新型网络攻击,Gemini 4 Argon 经专项训练,具备极强的网络安全防御能力,可自主发现、验证并修复关键软件漏洞。Google 向信赖的安全员及内部团队提供无网络安全护栏版本,以充分发挥其前沿防御潜力。
网络安全公司 Wiz 已通过“Scan for Good”倡议应用 Argon,旨在免费保护关键公共基础设施。早期展示中,该模型成功发现了一处影响全球医院医疗软件的致命漏洞,此漏洞此前被其他前沿模型遗漏,可能导致敏感个人信息泄露。
在评估模型安全漏洞修复能力的 CWE-bench v1 测试中,Argon 以 68% 的最高分并列第一,进一步突破了 3.8 Flash Cyber 在 CWE-bench v0 中的优异表现。
相较于 3.8 Flash Cyber,Gemini 4 Argon 在漏洞发现能力上实现飞跃:
在全面推出 Gemini 4 Argon 之前,Google 将在四个关键领域加强前沿安全保障:
防范滥用:为防止恶意行为者利用 Argon 进行网络攻击或涉及 CBRN(化学、生物、放射性与核武器)的攻击,模型被设计为拒绝有害请求,同时保留合法的双重用途科学研究能力。Google 强化了安全护栏,升级内部激活监测技术,并通过内外红队结合手动与自动攻击的方式进行了稳健性测试。
抵御提示词注入攻击:Argon 是 Google 迄今为止在防范间接提示词注入方面最具韧性的模型。通过自动化红队测试和对抗性训练,其在 Gray Swan 的间接提示词注入(IPI)基准测试中,稳健性处于领先地位。
对齐监测:Google 使用类似系统监控训练运行并向事件响应团队发送警报。为避免模型形成规避监控的能力,公司采取谨慎措施,不将研究结果直接反馈回训练。同时鼓励业界在提升模型能力时保持推理过程透明度,以助于识别和诊断不对齐问题。
系统加固:为匹配前沿模型日益增强的能力,Google 在高风险训练或评估前,通过隔离和密封加固沙盒环境,并与合作伙伴分享智能体安全最佳实践,以提升生态系统整体安全性。
Gemini 4 Argon 集前沿级编程、知识工作、网络安全防御和创意写作能力于一体,旨在成为开发者、专业人士和企业攻克棘手问题的得力伙伴。Google 感谢首批网络安全防御人员和信赖测试人员的实地评估与反馈,这将帮助公司在面向付费 API 客户和 Google AI Ultra 订阅者正式发布前,进一步强化系统。



