大数跨境

Gemini 4 Argon:迈入前沿智能新时代

Gemini 4 Argon:迈入前沿智能新时代 谷歌黑板报
2026-10-01
3
导读:无论是在真实的软件工程、法律与金融等企业知识工作,还是网络安全防御领域,Gemini 4 Argon 都能应对复杂的工作流,展现出前沿级别的卓越性能。


作者:

Koray Kavukcuoglu,Google DeepMind 高级副总裁兼 Google 首席 AI 架构师



Google 正式推出前沿 AI 模型 Gemini 4 Argon。目前,该模型正通过“Fairwind 计划”向部分网络安全专家开放试用。Argon 专为处理复杂长流程任务中的深度推理而设计,已在软件工程、法律金融等企业知识工作及网络安全防御领域展现出顶尖性能,从根本上改变了 Google 内部的开发与工作模式。


为确保安全,Google 正积极参与美国政府模型发布前的自愿评估,并分阶段放开访问权限。在全面面向开发者及企业用户之前,将持续收集早期反馈以完善安全防护。


Argon 首发优惠价为:输入 Token 每百万个 2 美元,输出 Token 每百万个 10 美元,缓存输入 Token 享受 95% 折扣。


重塑 Google 的工作与开发方式

Gemini 4 Argon 已深度融入 Google 内部工作流,数千名员工反馈其在专业代码编写、深度研究及写作质量方面表现卓越,显著提升了开发进度与技术突破速度:


  • 量子算法优化:协助研究人员优化量子计算中的“时空资源”。在实际案例中,仅用几分钟便将已知公开的最佳基准提升了 40%。

  • 内存使用效率:Argon Agent 团队通过分析全集群性能遥测数据,自主识别并部署内存优化方案,项目上线即释放超 300 TiB 内存,预计整体节省规模达 500 TiB 至 1 PiB。

  • 超大规模代码库迁移与优化:正在将 Google 内部 C/C++ 代码库向 Rust 迁移,处理规模从几万行的核心库到 Fuchsia OS Zircon 内核超 80 万行的庞大系统。所有迁移均经过严苛的自动化与人工审计、仿真测试及代码复核。



以开源视频解码软件 libgav1 为例,Argon Agent 基于现有 Rust 版本进行优化,通过多轮性能引导分析与编译器研究,生成可自动向量化的安全 Rust 代码,成功替换 3.2 万行 SIMD 代码。最终打造的内存安全视频解码器,运行速度比原 Rust 版快 2.7 倍,性能逼近高度优化的 C++ 版本,且视频输出完全一致。


倾力解决最棘手的难题

为应对更长、更复杂的使用场景,Gemini 4 Argon 的输出 Token 上限大幅提升至行业领先的 100 万(此前为 6.4 万)。充足的发挥空间使其能在单次推演中进行深度思考,从而一步到位解决各类硬核难题。


实现跨领域的编码和企业工作流程

Gemini 4 Argon 具备出色的代码编写、逻辑推理和多模态能力,以及处理长流程任务的持续执行力,在多领域企业工作流中表现优异。


Google 工程师已将其用于代码调试、大规模迁移及算法设计等任务。在衡量真实世界长周期软件工程任务的 DeepSWE v1.1 基准测试中,Argon 以 77.9% 的得分刷新行业纪录。


在非代码领域,Argon 在 Vals 指数(衡量金融、编码、法律和税务工作的经济影响)中名列前茅,并在 Vals Finance Agent v2 和 Harvey’s Legal Agent Benchmark 等特定领域评估中表现领先。在 Zapier 的 AutomationBench 基准测试中,Argon 以 51.3% 的得分位居榜首,展现了强大的端到端业务功能执行力。


Argon 在视觉理解方面也优势独特,能进行专业图表分析、长视频细节识别及文档行动执行。在 LVBench 长视频理解测试中,其得分高达 91.7%。



引领防御性网络安全

为应对新时代网络攻击,Gemini 4 Argon 经专项训练具备极强的网络安全防御能力,可自主发现、验证并修复关键软件漏洞。Google 向信赖的安全员及内部团队提供无网络安全护栏版本,以充分发挥其前沿防御能力。


网络安全公司 Wiz 已通过“Scan for Good”倡议将 Argon 应用于保护关键公共基础设施。早期展示中,该模型成功发现了一处此前其他前沿模型均漏掉的、影响全球医院医疗软件的致命漏洞,避免了敏感个人信息泄露。


在评估模型安全漏洞修复能力的 CWE-bench v1 测试中,Argon 以 68% 的最高分并列第一,进一步突破了此前 3.8 Flash Cyber在 CWE-bench v0 取得的优异表现。



与 3.8 Flash Cyber 相比,Gemini 4 Argon 在漏洞发现能力上实现飞跃:



  • 在 Google 内部综合漏洞测试中,Argon 在涵盖 20 种编程语言的复杂代码库中,挖掘出极广范围的安全隐患。

  • 在 Wiz 内部黑盒渗透测试(评估无源码环境下的实时 Web 系统分析能力)中,Argon 在攻击面识别、漏洞发现及概念验证(PoC)证据生成等维度上,全面超越 3.8 Flash Cyber。




在广泛推出之前加强前沿安全保障

在全面推出 Gemini 4 Argon 之前,Google 继续在以下四个关键领域加强前沿安全保障:


防范滥用:为防止恶意行为者将 Argon 用于网络攻击或化学、生物、放射性与核武器(CBRN)攻击,模型被设计为拒绝有害请求,同时保留合法的双重用途科学研究。本次发布强化了安全护栏,包括升级内部激活监测技术,并通过内部和外部红队结合手动与自动攻击的方法进行了稳健性测试。


抵御提示词注入攻击:Argon 是迄今为止在防范间接提示词注入方面最具韧性的模型。通过自动化红队测试和对抗性训练,其在 Gray Swan 的间接提示词注入(IPI)基准测试中,提示词注入稳健性处于领先地位。



对齐监测:使用类似系统监控训练运行并向专门的事件响应团队发送警报。为避免 Argon 形成规避监控的推理能力,采取了谨慎预防措施,避免将研究结果反馈回训练中。业界同仁被鼓励在提升模型能力时保持推理过程透明度,以助于识别和诊断不对齐问题。


系统加固:为安全测试前沿模型,需建立与其能力相匹配的安全环境。与智能体控制路线图一致,在高风险训练或评估开始前,通过隔离和密封加固沙盒环境,并致力于与合作伙伴分享智能体安全最佳实践。


即将上线

Gemini 4 Argon 具备前沿级编程、知识工作、网络安全防御和创意写作能力,是开发者、专业人士和企业攻克棘手问题的得力伙伴。Google 感谢首批网络安全防御人员和信赖测试人员的实地评估与反馈,这将帮助系统在面向付费 API 客户和 Google AI Ultra 订阅者发布前得到进一步强化。


【声明】内容源于网络
0
0
谷歌黑板报
谷歌黑板报
内容 738
粉丝 0
谷歌黑板报 谷歌黑板报
总阅读9.3k
粉丝0
内容738