英伟达发布 Vera Rubin NVL72:Agent 时代算力新基准
英伟达正式公布下一代旗舰机柜 Vera Rubin NVL72 的首次片上实测数据。本次测试采用 DeepSeek-V4-Pro 模型,运行真实的「智能体编码」任务。数据显示,相较于当前主力机型 GB300 NVL72,Vera Rubin 的每兆瓦吞吐量最高提升 30 倍,Token 生成成本最高降低 35 倍。
从 H200 到 GB300,真实 Agent 工作负载吞吐量提升约 30 倍;从 GB300 到 Vera Rubin,吞吐量再次跃升 30 倍。这意味着在两年间,英伟达通过系统级优化实现了近 900 倍的速度飞跃。英伟达指出,LLM 时代的传统跑分基准已失效,Agent 时代的全新性能标准正式确立。
此外,专为智能体设计的 Vera CPU 已获得马斯克 SpaceXAI 的部署认可,计划用于太空项目;同时,NVIDIA Groq 3 LPX 加速器全面量产,Gemma 4 31B 模型在其上的运行速度达到每秒 3400 Token。
为何必须推出 Vera Rubin?Agent 负载的革命性变化
OpenRouter 数据显示,真实世界中的 Agent AI 任务消耗的 Token 数量是普通聊天对话的 15 倍。在投资决策等复杂场景中,智能体需不断推理、累积上下文并调用工具,长上下文处理能力成为关键瓶颈。
随着智能体交互频次增加,吞吐量需求激增。算力和算法的矛盾催生了对新架构的迫切需求,传统针对单一推理请求的基准测试已无法反映真实性能。
废弃旧基准:重新定义 Agent 工作流测试
英伟达强调,性能测量必须进化,需捕捉完整的 Agent 工作流而非单一的问答序列。为此,官方采用了 SemiAnalysis 旗下的 AgentX 基准测试。
该测试回放具有上下文增长、工具调用和子智能体生成的真实「代码编写会话」。在此新标准下,H200 显得力不从心,而 Vera Rubin 展现出统治级性能。
Vera Rubin NVL72 × DeepSeek-V4-Pro:能效与成本的突破
每兆瓦吞吐量飙升 30 倍
在 AgentX 工作负载下,使用 DeepSeek-V4-Pro (1.6T) 进行实测,Vera Rubin NVL72 的每兆瓦吞吐量较 GB300 NVL72 提升 30 倍。考虑到 GB300 相较 H200 已有 15 倍提升,Vera Rubin 进一步拓展了物理法则边界。
对于受限电力的「AI 工厂」,同等预算下可获得 30 倍算力资产。结合 NVIDIA DSX MaxLPS 技术,可在相同兆瓦预算内多配置高达 40% 的 GPU,进一步优化能效。
Token 成本降低 35 倍
性能飞跃直接重塑商业模式。Vera Rubin NVL72 生产每百万 Token 的成本较 GB300 NVL72 降低 35 倍。
推理成本的断崖式下跌将使 24 小时无休的数字员工成为现实,推动 ToC 端超级应用的爆发。
极致协同设计:系统级创新
Vera Rubin 的性能提升源于「极致协同设计」,包括分离式服务、分布式 KV 缓存、KV 感知路由及 MegaMoE 等技术。
NVFP4 量化技术将模型权重压缩至 4 位精度,大幅缩减内存占用。第六代 NVLink 提供比以太网快 10 倍、延迟低 3 倍的互联网络,支持 DeepSeek 等 MoE 架构模型在 72 个 GPU 间高效调度。
Groq 3 LPX 全面量产:解码延迟的终结者
在 Hot Chips 2026 大会上,英伟达宣布 Groq 3 LPX 全面量产。作为 Vera Rubin 平台的专属扩展,该加速器主打低延迟推理,源自英伟达对 Groq 技术的整合。
针对智能体的解码延迟痛点,Groq 3 LPX 将上下文处理(由 Rubin GPU 负责)与 Token 生成(由 LPX 负责)彻底分离,实现读写分工。
在机架级部署中,多达 256 个 LPX 加速器可通过高带宽互连协同工作。测试显示,在 10 万 Token 上下文下运行 Gemma 4 31B,输出速度达 3,400 Token/秒,响应速度比竞品快 4 倍。
生成 5000 Token 的时间从 50 秒缩短至 1.5 秒,效率提升 34 倍;在编码任务中,最大输出速度可达 6981 Token/秒。
Nebius 已在 Token Factory 中部署该芯片,实现智能体循环的即时响应。
Vera CPU:首款 Agent 专属处理器
专为复杂调度而生
Vera CPU 配备 88 个自研 Olympus 核心及带宽达 1.2TB/s 的 LPDDR5X 内存,专为处理 Agent 背后上百步的工具调用、代码执行及数据翻查等复杂调度任务。
英伟达高管指出,Agentic AI 是史上最复杂的计算任务,必须拥有专用 CPU 支撑。
SpaceXAI 部署并计划送上太空
SpaceXAI 已宣布规模化部署 Vera CPU,并基于 Vera Rubin 平台建设吉瓦级算力工厂以驱动 Grok 模型。马斯克透露,双方合作设计的优化版 Vera Rubin NVL72 将于 2028 年大规模部署,首代「Starmind」AI 卫星将采用该系统,直接服务于太空任务。
结语:从 GPU 到 AI 工厂的跨越
随着 Vera CPU 和 Groq 3 LPX 的全面量产,英伟达的版图已从单一的 GPU 延伸至 CPU、推理加速器及高速互联网络。英伟达不再仅仅出售硬件,而是提供一座可持续生产 Token 的「AI 工厂」,为整个 Agent 时代重建基础设施。

