作者:
Koray Kavukcuoglu,Google DeepMind 高级副总裁兼 Google 首席 AI 架构师
Google 正式推出前沿 AI 模型 Gemini 4 Argon。目前,该模型正通过“Fairwind 计划”向部分网络安全专家开放试用。Argon 专为处理复杂长流程任务中的深度推理而设计,已在软件工程、法律金融等企业知识工作及网络安全防御领域展现出顶尖性能,从根本上改变了 Google 内部的开发与工作模式。
为确保安全,Google 正积极参与美国政府模型发布前的自愿评估,并分阶段放开访问权限。在全面面向开发者及企业用户之前,将持续收集早期反馈以完善安全防护。
Argon 首发优惠价为:输入 Token 每百万个 2 美元,输出 Token 每百万个 10 美元,缓存输入 Token 享受 95% 折扣。
重塑 Google 的工作与开发方式
Gemini 4 Argon 已深度融入 Google 内部工作流,数千名员工反馈其在专业代码编写、深度研究及写作质量方面表现卓越,显著提升了开发进度与技术突破速度:
以开源视频解码软件 libgav1 为例,Argon Agent 基于现有 Rust 版本进行优化,通过多轮性能引导分析与编译器研究,生成可自动向量化的安全 Rust 代码,成功替换 3.2 万行 SIMD 代码。最终打造的内存安全视频解码器,运行速度比原 Rust 版快 2.7 倍,性能逼近高度优化的 C++ 版本,且视频输出完全一致。
倾力解决最棘手的难题
为应对更长、更复杂的使用场景,Gemini 4 Argon 的输出 Token 上限大幅提升至行业领先的 100 万(此前为 6.4 万)。充足的发挥空间使其能在单次推演中进行深度思考,从而一步到位解决各类硬核难题。
实现跨领域的编码和企业工作流程
Gemini 4 Argon 具备出色的代码编写、逻辑推理和多模态能力,以及处理长流程任务的持续执行力,在多领域企业工作流中表现优异。
Google 工程师已将其用于代码调试、大规模迁移及算法设计等任务。在衡量真实世界长周期软件工程任务的 DeepSWE v1.1 基准测试中,Argon 以 77.9% 的得分刷新行业纪录。
在非代码领域,Argon 在 Vals 指数(衡量金融、编码、法律和税务工作的经济影响)中名列前茅,并在 Vals Finance Agent v2 和 Harvey’s Legal Agent Benchmark 等特定领域评估中表现领先。在 Zapier 的 AutomationBench 基准测试中,Argon 以 51.3% 的得分位居榜首,展现了强大的端到端业务功能执行力。
Argon 在视觉理解方面也优势独特,能进行专业图表分析、长视频细节识别及文档行动执行。在 LVBench 长视频理解测试中,其得分高达 91.7%。
引领防御性网络安全
为应对新时代网络攻击,Gemini 4 Argon 经专项训练具备极强的网络安全防御能力,可自主发现、验证并修复关键软件漏洞。Google 向信赖的安全员及内部团队提供无网络安全护栏版本,以充分发挥其前沿防御能力。
网络安全公司 Wiz 已通过“Scan for Good”倡议将 Argon 应用于保护关键公共基础设施。早期展示中,该模型成功发现了一处此前其他前沿模型均漏掉的、影响全球医院医疗软件的致命漏洞,避免了敏感个人信息泄露。
在评估模型安全漏洞修复能力的 CWE-bench v1 测试中,Argon 以 68% 的最高分并列第一,进一步突破了此前 3.8 Flash Cyber在 CWE-bench v0 取得的优异表现。
与 3.8 Flash Cyber 相比,Gemini 4 Argon 在漏洞发现能力上实现飞跃:
在广泛推出之前加强前沿安全保障
在全面推出 Gemini 4 Argon 之前,Google 继续在以下四个关键领域加强前沿安全保障:
防范滥用:为防止恶意行为者将 Argon 用于网络攻击或化学、生物、放射性与核武器(CBRN)攻击,模型被设计为拒绝有害请求,同时保留合法的双重用途科学研究。本次发布强化了安全护栏,包括升级内部激活监测技术,并通过内部和外部红队结合手动与自动攻击的方法进行了稳健性测试。
抵御提示词注入攻击:Argon 是迄今为止在防范间接提示词注入方面最具韧性的模型。通过自动化红队测试和对抗性训练,其在 Gray Swan 的间接提示词注入(IPI)基准测试中,提示词注入稳健性处于领先地位。
对齐监测:使用类似系统监控训练运行并向专门的事件响应团队发送警报。为避免 Argon 形成规避监控的推理能力,采取了谨慎预防措施,避免将研究结果反馈回训练中。业界同仁被鼓励在提升模型能力时保持推理过程透明度,以助于识别和诊断不对齐问题。
系统加固:为安全测试前沿模型,需建立与其能力相匹配的安全环境。与智能体控制路线图一致,在高风险训练或评估开始前,通过隔离和密封加固沙盒环境,并致力于与合作伙伴分享智能体安全最佳实践。
即将上线
Gemini 4 Argon 具备前沿级编程、知识工作、网络安全防御和创意写作能力,是开发者、专业人士和企业攻克棘手问题的得力伙伴。Google 感谢首批网络安全防御人员和信赖测试人员的实地评估与反馈,这将帮助系统在面向付费 API 客户和 Google AI Ultra 订阅者发布前得到进一步强化。

