如果一辆车在路口遇到一个从车缝里突然冲出来的行人,它真正需要解决的,绝不是“我看到了一个人”。
而是:
这个人接下来会往哪里走?
旁边那辆车会不会突然变道?
我是应该刹车、让行,还是继续通过?
更重要的是——为什么要这么做?这才是自动驾驶真正难的地方。因为在真实道路上,最危险的往往不是那些“训练数据里见过100万次”的标准场景,而是那些一年可能只遇到一次、甚至一次都没遇到过的极端情况。
现在,NVIDIA又往前推了一步。
就在 8 月,NVIDIA正式发布 Alpamayo 2 Super,并开放商业使用。它不是简单的“看图识物”模型,而是一个专门面向自动驾驶的推理型基础模型。NVIDIA称,它在自动驾驶推理以及多项自动驾驶基准测试中达到领先水平。(NVIDIA Blog)
而我认为,这件事情真正值得关注的,并不是“又发布了一个AI模型”。
而是:
自动驾驶AI,正在从“看见世界”,走向“理解世界、分析世界,然后决定怎么做”。

01
PART
自动驾驶 → 最难的?
从来不是“看见”
过去我们理解自动驾驶,脑子里往往是这样的画面:摄像头拍到道路,AI识别:
汽车
行人
自行车
红绿灯
车道线
交通标志
然后再预测:
这辆车往哪里走?
这个行人往哪里走?
最后规划车辆轨迹,这种思路当然没有错。但问题是,真实世界远比这复杂。比如你正在开车,前方路口:
-
左边有一辆车准备转弯; -
右边有一辆自行车; -
前方行人刚刚迈出一步; -
对向车辆打了转向灯; -
前面的车辆突然减速。
这时候,自动驾驶系统真正需要解决的是一个多主体、多因素、强不确定性的决策问题。
它必须理解:
“现在发生了什么?”
然后进一步判断:
“接下来可能发生什么?”
最后决定:
“我应该怎么做?”
这已经不是传统意义上的目标检测了,而是推理。NVIDIA推出 Alpamayo 2 Super,就是在解决这个问题。

02
PART
自动驾驶 → Alpamayo 2 Super
到底是什么
简单来说:它可以把它理解成一个专门给自动驾驶汽车使用的“大脑”。
NVIDIA表示,Alpamayo 2 Super 构建于 Cosmos 3 Super Reasoner 之上,并通过强化学习进行后训练,面向机器人出租车和自动驾驶汽车提供多任务能力。这里有一个非常关键的变化。以前我们经常把自动驾驶系统拆成很多模块:
摄像头
↓
目标检测
↓
目标跟踪
↓
场景理解
↓
行为预测
↓
轨迹规划
↓
车辆控制
每一个模块解决一个问题。而 Alpamayo 2 Super 希望把更多能力放进一个统一的基础模型里。也就是说,它不仅仅负责:
“我看到了什么。”还要负责:“这意味着什么?”以及:“我接下来应该怎么办?”
这就是今天AI领域一个非常明显的趋势:
从感知模型,走向推理模型。

03
PART
只给答案 → 解释为什么?
从最有意思的地方
这是我认为 Alpamayo 2 Super 最值得技术人员关注的地方。NVIDIA给这个模型设计了一个非常特别的输出体系。面对一个驾驶场景,它可以同时输出五类结果:
① 轨迹
也就是:车接下来准备怎么走。
例如:
减速
→
向右偏移
→
避让行人
→
继续直行
这对应真正的车辆运动规划。
② Chain-of-Causation
也就是所谓的:因果链推理。
你可以简单理解成:
我看到了什么
↓
发生了什么
↓
可能会发生什么
↓
存在什么风险
↓
所以我决定怎么做
这和我们平时使用大语言模型时看到的“思考过程”有一点相似。但自动驾驶里面更加重要。因为一辆车做出的决定,不能只是:
“AI说应该刹车。”
工程师真正想知道的是:
为什么刹车?
-
是因为检测到了行人? -
还是因为判断行人可能横穿? -
还是因为旁边车辆可能压线? -
还是因为几个因素共同导致风险增加?
Alpamayo 2 Super就是在尝试让这种决策过程更加可检查。NVIDIA表示,其 Chain-of-Causation(CoC)推理轨迹可以与 NVIDIA Halos 安全验证工作流结合,并支持面向 ISO/PAS 8800 的AI安全验证。
04
PART
数据标签 → AI自己打标签
最关键的东西
这个能力可能比很多普通用户想象得更重要。为什么?因为自动驾驶最大的成本之一,就是:
数据。
你可以想象一下,一家车企每天有多少辆测试车在路上跑。摄像头不断产生:
视频
图片
车辆轨迹
驾驶行为
各种极端场景
这些数据如果全部靠人工标注,成本有多高?而 Alpamayo 2 Super 可以作为一个 autolabeler(自动标注器)。它可以分析车辆采集的大量驾驶视频,然后自动生成:
场景理解
+
因果关系
+
推理标签
+
视觉问答
+
2D视觉定位
NVIDIA表示,这种能力可以把原本可能需要数月的部分数据标注流程压缩到数天。这就很有意思了。因为AI不仅仅是在:
使用数据。
它开始参与:
制造下一代AI训练数据。
这其实是一个非常重要的闭环:
真实道路
↓
采集数据
↓
Alpamayo 自动理解
↓
生成训练标签
↓
训练更小、更快的模型
↓
部署到车辆
↓
继续采集真实数据
↓
再训练
这才是一个真正可以不断迭代的自动驾驶AI系统。
05
PART
大模型负责想→ 小模型负责跑
Nvidia最现实设计
这里其实是整个 Alpamayo 2 Super 最值得工程师关注的地方之一。
你可能会问:
这么大的模型,难道直接塞进汽车里面实时运行?
当然不是这么简单。NVIDIA给出的思路是:云端负责高质量推理,车端负责高效率执行。
可以理解成:
云端
│
Alpamayo 2 Super
│
高质量推理/教师模型
│
生成推理数据
↓
模型蒸馏 / 专项训练
↓
更小、更快的模型
│
↓
汽车
│
实时运行
NVIDIA把这个过程称为 cloud-to-car workflow。
Alpamayo 2 Super负责更高质量的推理、生成训练数据和教师输出,而 Alpamayo 1.5、Alpamayo 1 等更轻量的模型可以承担成本更低的开发和蒸馏任务,最终把专门优化后的模型部署到车辆中。(NVIDIA Blog)
这其实和现在大模型领域的:Teacher → Student → Distillation,是一个非常类似的思路。
06
PART
为什么叫 “ Super”
值得注意的数字
Alpamayo 2 Super 的模型规模,是 Alpamayo 1 和 1.5 的大约 3倍。
NVIDIA表示,这种规模提升有助于模型从稀疏样本中更好地泛化推理能力,尤其针对那些罕见、多主体交互的复杂驾驶场景。
这背后的逻辑其实很好理解。假设一个模型只见过:
汽车正常行驶
汽车正常变道
行人正常过马路
那么遇到一个从两辆车之间突然冲出来的行人,它可能就比较难处理。
但是更强的推理模型可以利用已有知识进行组合:
车辆运动规律
+
行人行为
+
道路结构
+
历史经验
+
当前视觉信息
最终推断:
这个行人虽然现在还没有进入我的车道,但很可能马上进入,因此应该提前减速。
这就是所谓的:从“记住案例”,到“理解规律”。
07
PART
360 度无死角影像
AI 视觉
另一个很关键的变化,是 Alpamayo 2 Super并不是只盯着前方。
它可以融合车辆前方、侧方和后方的摄像头信息。
也就是说:
它获得的是一个完整的360°驾驶环境上下文。
这对于:
-
加塞 -
汇入 -
变道 -
无保护左转/右转 -
复杂路口 -
多车交互
尤其重要。因为很多危险根本不来自正前方。例如:
你前面看起来一切正常,但左后方突然有一辆高速接近的汽车。
如果AI只看前摄像头,它很难做出正确判断。而真正的自动驾驶必须具备:
“我不仅知道前面发生了什么,还知道整个车周围正在发生什么。”
08
PART
性能到底有多强?
性能测试
这也是大家最关心的问题。
NVIDIA公布的信息显示,Alpamayo 2 Super在 LingoQA 自动驾驶推理基准上排名第一。
NVIDIA称,在接近40个参评模型中,它在 Lingo-Judge 指标上的表现:
-
比 Qwen2.5-VL 72B 高 17.0分 -
比 Gemini 2.5 Pro 高 15.1分 -
比 GPT-4o 高 23.2分

同时,NVIDIA表示 Alpamayo 2 Super 在其评测的各项自动驾驶基准中均排名第一。当然,这里必须提醒一句:
这些是NVIDIA公布的测试结果。
不同模型、不同基准、不同测试条件之间不能简单理解成:
“它全面超过所有大模型。”
更准确的说法是:
在NVIDIA公布的自动驾驶相关测试中,Alpamayo 2 Super展现出了非常强的驾驶推理能力。
这才是严谨的技术结论。

09
PART
开发,可商用
最值得关注的
如果只是发布一个性能很强的模型,我可能不会觉得特别意外。真正值得关注的是:
Alpamayo 2 Super现在开放商业使用。它在 Hugging Face 上采用 OpenMDW-1.1 许可。
按照NVIDIA的介绍,这一许可允许开发者:
-
Fine-tuning -
构建衍生模型 -
商业重新分发
也就是说,汽车厂商、自动驾驶公司、卡车制造商以及供应商,都可以基于自己的数据和驾驶策略继续改造它。这和以前“只能研究,不能真正商用”的开放模型路线相比,是非常大的变化。
因为对于车企来说,真正重要的不是:
“你给我一个模型。”
而是:
“我能不能拿这个模型和我的数据结合?”
“我能不能训练出自己的版本?”
“我能不能部署到自己的车里?”
“我能不能掌握最终的数据和模型能力?”
开放权重 + 商业许可,恰恰解决的是这些问题。
10
PART
自动驾驶 → 意味着什么?
走向物理世界的意义?
如果把这件事情放到更大的AI发展趋势里,我认为有三个变化值得关注。
第一个变化:AI正在从“数字世界”走向“物理世界”
过去我们讨论AI,更多是:
聊天
写代码
画图
写文章
生成视频
这些事情都发生在屏幕里。但自动驾驶不一样。AI说错一句话,最多让你重新问一次。
AI在汽车里做错一个决定,后果可能完全不同。
所以物理世界对AI的要求会高得多:
看得懂
+
想得清
+
反应快
+
能解释
+
可验证
+
足够安全
这也是为什么 NVIDIA把 Alpamayo 放在 Physical AI 的大框架里。
第二个变化:未来的自动驾驶竞争,可能越来越像“大模型竞争”
以前自动驾驶公司拼的是:
感知算法
+
传感器
+
规则
+
规划
以后很可能会越来越多地变成:
基础模型
+
数据
+
推理能力
+
仿真
+
强化学习
+
蒸馏
+
安全验证
谁拥有更强的基础模型,谁就拥有更强的“驾驶大脑”。
第三个变化,也是我认为普通人最值得关注的:AI开始真正进入汽车。
这意味着未来汽车可能不再只是:
一台会自动开车的机器。
而更像:
一个能够理解周围世界、预测其他人的行为,并自主做决定的智能体。
今天我们觉得“自动驾驶”还像一个汽车功能。但再往后,它可能会逐渐变成:汽车本身的核心智能。
最后说两句
我一直觉得,判断一个AI模型有没有真正的未来,不应该只看它的参数量,也不应该只看排行榜上的一个数字。
更应该看一件事:
它有没有进入真实世界的能力。
Alpamayo 2 Super让我比较关注的地方,恰恰不是“它又超过了哪个模型”。
而是它把几个东西开始真正串起来了:
真实道路数据 ↓ AI理解 ↓ AI推理 ↓ 自动生成训练数据 ↓ 模型蒸馏 ↓ 车端部署 ↓ 安全验证 ↓ 再次进入真实世界
这已经不是一个单纯的“自动驾驶模型”。而是在形成一套从云端训练到汽车落地的AI基础设施。
而这也可能是下一阶段AI竞争最值得关注的方向:
不是谁的聊天机器人更会说话,而是谁的AI真正开始理解这个物理世界。
NVIDIA目前已经把 Alpamayo 2 Super、AlpaSim、AlpaGym、Physical AI 数据集以及训练和自动标注工具组合成一个更完整的自动驾驶开放生态;NVIDIA还表示,整个 Alpamayo 模型家族在 Hugging Face 的下载量已经超过50万。
对于汽车行业、自动驾驶工程师、AI研究人员,甚至只是一个每天开车上下班的普通人来说,这可能都值得关注。
因为下一次你坐进一辆没有方向盘的汽车时,真正坐在“驾驶位”上的,可能已经不再是一个传统意义上的自动驾驶算法。
而是一个会观察、会推理、会做决定的AI。


