谷歌发布Gemini 4 Argon:百万Token输出重塑企业级AI应用
谷歌正式推出Gemini 4 Argon模型,将单次输出上限提升至100万Token。该模型在多项基准测试中表现优异,超越Opus 5.5、Fable 5.1及GPT-6 Astra等竞品,但在Terminal-bench 4.0编程基准测试中仍有提升空间。
Argon主要面向软件工程、法律金融等企业级知识工作及网络安全防御场景。目前,该模型正通过Fairwind计划向受信任的网络安全人员开放,并接受美国政府发布前审查,后续将逐步面向付费API开发者及Google AI Ultra订阅用户推送。
定价方面,Argon百万输入Token收费2美元,百万输出Token收费10美元,缓存输入享受5折优惠。
内部实战:重构80万行代码与优化量子算法
谷歌数千名员工已将Argon深度融入日常研发工作,成效显著:
- 量子计算:协助研究人员优化子例程时空资源,几分钟内将公开基线性能提升40%。
- 数据中心运维:智能体团队通过分析全网遥测数据自主完成内存优化,已释放超300 TiB内存,预计总节省量可达500 TiB至1 PiB。
- 代码重构:正在将大规模C/C++代码库迁移至Rust,涉及re2、libgav1等核心库及Fuchsia Zircon内核的80多万行代码。所有重写均经过严格自动化审计、模拟测试及人工审查。
- 性能提升:在开源视频解码项目libgav1中,Argon将32000行SIMD代码替换为安全的Rust代码,运行速度较原Rust移植版提升2.7倍,性能持平高度优化的C++版本。
技术突破:百万Token输出与长程推理能力
为应对长周期、多步骤复杂任务,谷歌将Argon的单次输出Token上限从64K大幅提升至100万。这使得模型能在单次推理轨迹中生成数十万Token,实现连续深度推理,显著提升处理复杂逻辑的能力。
基准测试:多领域综合表现领先
Argon在多个关键基准测试中取得SOTA(当前最佳)成绩:
- 软件工程:在衡量真实长程软件工程能力的DeepSWE v1.1测试中,得分77.9%。
- 综合价值:在按美国GDP权重评估金融、编程、法律和税务价值的Vals Index测试中位列第一;在Vals Finance Agent v2金融研究及Harvey法律测试中同样领先。
- 业务执行:在Zapier评估企业核心业务端到端执行能力的AutomationBench上,以51.3%的分数位居榜首。
- 多模态理解:在多模态长视频理解测试LVBench中获得91.7%的高分。
网络安全:开放无护栏版本强化防御
Argon具备自主发现、验证和修复软件高危漏洞的能力。谷歌向受信任的防御机构及内部团队提供无安全护栏版本,以最大化其防御效能。
云安全机构Wiz已在“Scan for Good”项目中接入Argon,成功挖掘出全球多家医院医疗软件的重大漏洞,避免了敏感数据泄露。在评估漏洞修复能力的CWE-bench v1中,Argon以68%的得分并列行业第一。
在包含20种编程语言的内部测试及Wiz黑盒渗透测试中,Argon在寻找攻击面、发现漏洞及生成概念验证代码(PoC)方面,均显著优于此前的3.8 Flash Cyber模型。
安全防护:构建四重防线确保可控
在全面开放前,谷歌重点加固了四个维度的安全防护体系:
- 防范恶意滥用:严格拦截网络攻击及化生放核(CBRN)危害请求,并通过监测模型内部激活状态捕捉滥用迹象。
- 防范间接提示词注入:通过自动化红队测试和对抗训练,Argon在Gray Swan间接提示词注入基准测试中保持领先的抗攻击表现。
- 监控对齐漂移:实时监控思维链和实际动作,一旦偏离用户意图立即终止执行并警报。监控数据不反哺训练集,防止模型学会伪装以逃避监管。
- 系统环境加固:在高风险训练和评估前,对沙箱环境进行严格隔离与密封,确保运行环境安全可控。
--end--

