新智元报道
英伟达通用编码智能体 AVO 刚刚在 ARC-AGI-3 基准测试中斩获满分。该智能体在 25 个游戏环境中成功通关全部 183 个关卡,仅耗时 6624 步,RHAE 得分达到 100.00。
ARC-AGI-3 以高难度著称,智能体需在无规则说明、无目标指引的陌生游戏中,完全依靠自主观察与试错完成任务。环境机制复杂多变,有的涉及空间旋转,有的仅允许点击操作。每个环境包含至少六个关卡,难度随进程递增,且智能体仅拥有 64×64 网格视野及有限按键。
主流前沿模型在此任务上表现不佳。作为基座的 Claude Opus 5 单独参赛时,得分仅为 30.16%,虽位列官方榜单第一,但远未达到完美解决的程度。
ARC Prize 团队分析指出,现有模型主要存在三大缺陷:局部理解而缺乏全局观、机械套用熟悉机制、以及通过关卡却未真正习得规律。其中第三种情况尤为致命,模型常因初始错误假设而在后续关卡中陷入死循环。
|
|
英伟达的解决方案并非更换更强的基础模型,而是在模型外层构建了一套高效的代理架构(Harness)。依托同一款 Claude Opus 5,AVO 将成绩从 30 分提升至满分,引发了行业对“系统级智能”而非单纯“模型级智能”的广泛讨论。
100 分的跳跃,核心在于系统架构
AVO 的核心价值在于管理模型之外的关键要素:上下文构建、工具调用、状态存储、反馈机制及长程任务规划。具体而言,两大机制起到了决定性作用。
首先是持久记忆机制。针对长程任务中上下文窗口溢出导致记忆清零的问题,AVO 能够存储过往的实现版本、评测结果、编译器输出及推理过程。当上下文重置时,智能体可基于累积状态继续推进,避免重复试错。
其次是监督器机制。主智能体负责执行具体任务,而监督器则监控整体搜索轨迹。一旦检测到进展停滞或无效循环,监督器会立即干预,引导主智能体切换策略。
值得注意的是,AVO 在 ARC-AGI-3 测试中全程采用纯文本模态,将每一帧画面转化为精确的 64×64 文本网格,未使用任何图像 Token。这套系统架构最终实现了 6624 步通关 183 关的卓越成绩。
英伟达由此得出结论:长程智能能力并非单靠模型本身具备,而是由记忆留存、工具动作、反馈修正及假设迭代等系统组件共同构建的结果。
首战告捷:GPU 算子优化
AVO 的设计初衷并非为了玩游戏,其主战场是 GPU 算子优化。今年 3 月,英伟达在 arXiv 发表论文《AVO:面向自主进化搜索的智能体式变异算子》,详细阐述了其技术路径。
传统进化算法中的“变异算子”通常由人工预设或 LLM 单次生成,而 AVO 将其升级为自主智能体。该智能体能够阅读 CUDA 编程指南与 PTX 架构文档,运行测试,分析 Profiler 数据,并自主诊断故障以决定下一轮优化方向。
在 B200 显卡上,AVO 针对 Transformer 中极具挑战性的注意力内核进行了连续 7 天的自主探索,尝试了超过 500 个优化方向,最终提交 40 个有效内核版本。结果显示,其生成的多头注意力内核比英伟达闭源 cuDNN 快 3.5%,比开源最先进的 FlashAttention-4 快 10.5%。随后在 GQA 架构上的优化中,AVO 仅用 30 分钟便使新内核性能超越 cuDNN 7.0% 及 FlashAttention-4 9.3%。
无论是编写高难度的 CUDA 内核还是攻克像素游戏,底层逻辑是一致的:智能体基于残缺证据建立假设,通过执行与观察验证假设,保留有效状态并修正认知偏差。这种维持长程自主推进的机制具有高度的可迁移性。
华人核心团队打造
AVO 论文的作者阵容汇聚了深度学习领域的多位关键人物。共同一作许冰是英伟达杰出工程师、MXNet 作者,也是 GAN 原始论文的作者之一。TVM 和 XGBoost 作者陈天奇、FlashInfer 作者叶子豪、CUDA 编译器元老 Vinod Grover 等均名列其中。
项目由英伟达高性能 AI 副总裁 Humphrey Shi 领衔,另一位共同一作 Zhifan Ye 为佐治亚理工在读博士。博客署名的五位作者中,四位为华人。有趣的是,项目负责人许冰曾表示,团队最初并不精通 GPU 编程,因此从一开始就致力于构建完全自动化的“盲编程”系统,最终实现了对人类专家数月优化成果的超越。
商业逻辑:赋能算力生态
英伟达投入资源研发无需人工干预的智能体,其商业逻辑清晰:AVO 架构可适配任意大模型,其核心价值在于占据“系统层”。英伟达的策略是模型侧开源(如 Nemotron 系列),而通过长程智能体带来的高负载推理需求,最终将算力消耗转化为 GPU 销量。
随着推理拐点的到来,智能体任务越复杂、运行时间越长,对算力的需求就越大。尽管 ARC-AGI-3 满分记录近期频现,但 AVO 的意义在于证明了一套专为榨取硬件极限性能而生的架构,能够无缝迁移至完全不同领域并发挥作用。
正如英伟达所言,模型至关重要,但绝非智能体的全部。未来的竞争将更多体现在系统架构与工程化能力上。
参考资料:
https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/
编辑:摩西



