大数跨境

英伟达震撼首测Vera Rubin,DeepSeek吞吐暴涨30倍!

英伟达震撼首测Vera Rubin,DeepSeek吞吐暴涨30倍! 新智元
2026-08-25
99

英伟达发布 Vera Rubin NVL72:Agent 时代算力新基准

英伟达正式公布下一代旗舰机柜 Vera Rubin NVL72 的首次片上实测数据。本次测试采用 DeepSeek-V4-Pro 模型,运行真实的「智能体编码」任务。数据显示,相较于当前主力机型 GB300 NVL72,Vera Rubin 的每兆瓦吞吐量最高提升 30 倍,Token 生成成本最高降低 35 倍。

从 H200 到 GB300,真实 Agent 工作负载吞吐量提升约 30 倍;从 GB300 到 Vera Rubin,吞吐量再次跃升 30 倍。这意味着在两年间,英伟达通过系统级优化实现了近 900 倍的速度飞跃。英伟达指出,LLM 时代的传统跑分基准已失效,Agent 时代的全新性能标准正式确立。

此外,专为智能体设计的 Vera CPU 已获得马斯克 SpaceXAI 的部署认可,计划用于太空项目;同时,NVIDIA Groq 3 LPX 加速器全面量产,Gemma 4 31B 模型在其上的运行速度达到每秒 3400 Token。

为何必须推出 Vera Rubin?Agent 负载的革命性变化

OpenRouter 数据显示,真实世界中的 Agent AI 任务消耗的 Token 数量是普通聊天对话的 15 倍。在投资决策等复杂场景中,智能体需不断推理、累积上下文并调用工具,长上下文处理能力成为关键瓶颈。

随着智能体交互频次增加,吞吐量需求激增。算力和算法的矛盾催生了对新架构的迫切需求,传统针对单一推理请求的基准测试已无法反映真实性能。

废弃旧基准:重新定义 Agent 工作流测试

英伟达强调,性能测量必须进化,需捕捉完整的 Agent 工作流而非单一的问答序列。为此,官方采用了 SemiAnalysis 旗下的 AgentX 基准测试。

该测试回放具有上下文增长、工具调用和子智能体生成的真实「代码编写会话」。在此新标准下,H200 显得力不从心,而 Vera Rubin 展现出统治级性能。

Vera Rubin NVL72 × DeepSeek-V4-Pro:能效与成本的突破

每兆瓦吞吐量飙升 30 倍

在 AgentX 工作负载下,使用 DeepSeek-V4-Pro (1.6T) 进行实测,Vera Rubin NVL72 的每兆瓦吞吐量较 GB300 NVL72 提升 30 倍。考虑到 GB300 相较 H200 已有 15 倍提升,Vera Rubin 进一步拓展了物理法则边界。

对于受限电力的「AI 工厂」,同等预算下可获得 30 倍算力资产。结合 NVIDIA DSX MaxLPS 技术,可在相同兆瓦预算内多配置高达 40% 的 GPU,进一步优化能效。

Token 成本降低 35 倍

性能飞跃直接重塑商业模式。Vera Rubin NVL72 生产每百万 Token 的成本较 GB300 NVL72 降低 35 倍。

推理成本的断崖式下跌将使 24 小时无休的数字员工成为现实,推动 ToC 端超级应用的爆发。

极致协同设计:系统级创新

Vera Rubin 的性能提升源于「极致协同设计」,包括分离式服务、分布式 KV 缓存、KV 感知路由及 MegaMoE 等技术。

NVFP4 量化技术将模型权重压缩至 4 位精度,大幅缩减内存占用。第六代 NVLink 提供比以太网快 10 倍、延迟低 3 倍的互联网络,支持 DeepSeek 等 MoE 架构模型在 72 个 GPU 间高效调度。

Groq 3 LPX 全面量产:解码延迟的终结者

在 Hot Chips 2026 大会上,英伟达宣布 Groq 3 LPX 全面量产。作为 Vera Rubin 平台的专属扩展,该加速器主打低延迟推理,源自英伟达对 Groq 技术的整合。

针对智能体的解码延迟痛点,Groq 3 LPX 将上下文处理(由 Rubin GPU 负责)与 Token 生成(由 LPX 负责)彻底分离,实现读写分工。

在机架级部署中,多达 256 个 LPX 加速器可通过高带宽互连协同工作。测试显示,在 10 万 Token 上下文下运行 Gemma 4 31B,输出速度达 3,400 Token/秒,响应速度比竞品快 4 倍。

生成 5000 Token 的时间从 50 秒缩短至 1.5 秒,效率提升 34 倍;在编码任务中,最大输出速度可达 6981 Token/秒。

Nebius 已在 Token Factory 中部署该芯片,实现智能体循环的即时响应。

Vera CPU:首款 Agent 专属处理器

专为复杂调度而生

Vera CPU 配备 88 个自研 Olympus 核心及带宽达 1.2TB/s 的 LPDDR5X 内存,专为处理 Agent 背后上百步的工具调用、代码执行及数据翻查等复杂调度任务。

英伟达高管指出,Agentic AI 是史上最复杂的计算任务,必须拥有专用 CPU 支撑。

SpaceXAI 部署并计划送上太空

SpaceXAI 已宣布规模化部署 Vera CPU,并基于 Vera Rubin 平台建设吉瓦级算力工厂以驱动 Grok 模型。马斯克透露,双方合作设计的优化版 Vera Rubin NVL72 将于 2028 年大规模部署,首代「Starmind」AI 卫星将采用该系统,直接服务于太空任务。

结语:从 GPU 到 AI 工厂的跨越

随着 Vera CPU 和 Groq 3 LPX 的全面量产,英伟达的版图已从单一的 GPU 延伸至 CPU、推理加速器及高速互联网络。英伟达不再仅仅出售硬件,而是提供一座可持续生产 Token 的「AI 工厂」,为整个 Agent 时代重建基础设施。

【声明】内容源于网络
0
0
新智元
智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
内容 16491
粉丝 0
新智元 智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
总阅读357.4k
粉丝0
内容16.5k