大数跨境

Gemini 4 Argon: 迈入前沿智能新时代

Gemini 4 Argon: 迈入前沿智能新时代 谷歌开发者
2026-10-01
7
导读:无论是在真实的软件工程、法律与金融等企业知识工作、还是网络安全防御领域,Gemini 4 Argon 都能应对极具挑战的工作流,展现出顶尖的性能。


作者:

Koray Kavukcuoglu,Google DeepMind 高级副总裁兼 Google 首席 AI 架构师



Google 今日正式发布前沿 AI 模型 Gemini 4 Argon。目前,该模型正通过“Fairwind 计划”向部分网络安全专家开放试用。Argon 专为处理复杂长流程任务中的深度推理而设计,已显著改变 Google 内部的工作与开发模式,并在软件工程、法律金融等企业知识工作及网络安全防御领域展现出顶尖性能。


为确保安全,前沿技术的发布将分阶段进行。Google 正积极参与美国政府的模型发布前自愿评估流程,并逐步放开访问权限。在全面面向开发者、企业和用户开放前,公司将持续收集早期测试反馈,完善安全防护机制。


Argon 首发优惠价为:输入 token 每百万个 2 美元,输出 token 每百万个 10 美元;缓存输入 token 可享受 95% 的价格折扣。



重塑 Google 的工作与开发方式


Gemini 4 Argon 已全面支持 Google 内部工作流。数千名员工反馈显示,该模型在专业代码编写、深度研究及写作质量方面表现卓越,不仅加速了开发进度,更在多项技术突破中发挥关键作用:



  • 量子算法优化:协助研究人员优化量子计算中的“时空资源”。在实际案例中,Argon 仅用几分钟便将已知公开的最佳基准提升了 40%。

  • 内存使用效率:通过分析全集群性能遥测数据,自主识别并部署内存优化方案。项目上线即释放超 300 TiB 内存,预计整体节省规模达 500 TiB 至 1 PiB。

  • 超大规模代码库迁移与优化:主导 Google 内部 C/C++ 代码库向 Rust 的迁移,涵盖从核心库(如 re2、libgav1)到 Fuchsia OS Zircon 内核(超 80 万行)的大规模系统。所有重写均经过严格的自动化与人工审计、仿真测试及代码复核。



以开源视频解码软件 libgav1 为例,Argon Agent 基于现有 Rust 版本,通过多轮性能引导分析与编译器输出研究,生成了可自动向量化的安全 Rust 代码,成功替换 3.2 万行 SIMD 代码。最终打造的内存安全视频解码器,运行速度比原 Rust 版本快 2.7 倍,性能逼近高度优化的 C++ 版本。



倾力解决复杂难题


为应对更长、更复杂的使用场景,Gemini 4 Argon 的输出 token 上限大幅提升至行业领先的 100 万(此前为 6.4 万)。充足的生成空间使模型能展开深度思考,在单次推演中生成数十万 token,从而显著提升推理深度,一步到位解决硬核难题。




实现跨领域编码与企业工作流突破


Gemini 4 Argon 具备出色的代码编写、逻辑推理和多模态能力,以及处理长流程、多步骤任务的持续执行力,使其在企业工作流中表现优异。


Google 工程师已将 Argon 融入日常,用于代码调试、大规模代码库迁移及算法设计等任务。在衡量真实世界长周期软件工程任务的 DeepSWE v1.1 基准测试中,Argon 以 77.9% 的得分刷新行业纪录。


此外,Argon 在 Vals 指数(衡量金融、编码、法律和税务工作的经济影响)中名列前茅,并在 Vals Finance Agent v2 和 Harvey’s Legal Agent Benchmark 等特定领域评估中表现领先。在 Zapier 的 AutomationBench 基准测试中,Argon 以 51.3% 的得分位居榜首,展现了强大的端到端业务功能执行力。


在视觉理解方面,Argon 能进行专业图表分析、长视频细节识别及基于文档采取行动。在 LVBench 长视频理解测试中,其得分高达 91.7%。




引领防御性网络安全


为应对新型网络攻击,Gemini 4 Argon 经专项训练,具备极强的网络安全防御能力,可自主发现、验证并修复关键软件漏洞。Google 向信赖的安全员及内部团队提供无网络安全护栏版本,以充分发挥其前沿防御潜力。


网络安全公司 Wiz 已通过“Scan for Good”倡议应用 Argon,旨在免费保护关键公共基础设施。早期展示中,该模型成功发现了一处影响全球医院医疗软件的致命漏洞,此漏洞此前被其他前沿模型遗漏,可能导致敏感个人信息泄露。


在评估模型安全漏洞修复能力的 CWE-bench v1 测试中,Argon 以 68% 的最高分并列第一,进一步突破了 3.8 Flash Cyber 在 CWE-bench v0 中的优异表现。



相较于 3.8 Flash Cyber,Gemini 4 Argon 在漏洞发现能力上实现飞跃:



  • 在 Google 内部综合漏洞测试中,Argon 在涵盖 20 种编程语言的复杂代码库中,挖掘出广泛的安全隐患。

  • 在 Wiz 内部黑盒渗透测试中,Argon 在无源码环境下的实时 Web 系统分析、攻击面识别、漏洞发现及概念验证(PoC)证据生成等维度上,全面超越 3.8 Flash Cyber。




加强前沿安全保障


在全面推出 Gemini 4 Argon 之前,Google 将在四个关键领域加强前沿安全保障:


防范滥用:为防止恶意行为者利用 Argon 进行网络攻击或涉及 CBRN(化学、生物、放射性与核武器)的攻击,模型被设计为拒绝有害请求,同时保留合法的双重用途科学研究能力。Google 强化了安全护栏,升级内部激活监测技术,并通过内外红队结合手动与自动攻击的方式进行了稳健性测试。


抵御提示词注入攻击:Argon 是 Google 迄今为止在防范间接提示词注入方面最具韧性的模型。通过自动化红队测试和对抗性训练,其在 Gray Swan 的间接提示词注入(IPI)基准测试中,稳健性处于领先地位。



对齐监测:Google 使用类似系统监控训练运行并向事件响应团队发送警报。为避免模型形成规避监控的能力,公司采取谨慎措施,不将研究结果直接反馈回训练。同时鼓励业界在提升模型能力时保持推理过程透明度,以助于识别和诊断不对齐问题。


系统加固:为匹配前沿模型日益增强的能力,Google 在高风险训练或评估前,通过隔离和密封加固沙盒环境,并与合作伙伴分享智能体安全最佳实践,以提升生态系统整体安全性。



即将上线


Gemini 4 Argon 集前沿级编程、知识工作、网络安全防御和创意写作能力于一体,旨在成为开发者、专业人士和企业攻克棘手问题的得力伙伴。Google 感谢首批网络安全防御人员和信赖测试人员的实地评估与反馈,这将帮助公司在面向付费 API 客户和 Google AI Ultra 订阅者正式发布前,进一步强化系统。




【声明】内容源于网络
0
0
谷歌开发者
谷歌开发
内容 3603
粉丝 0
谷歌开发者 谷歌开发
总阅读39.3k
粉丝0
内容3.6k