大数跨境

刚刚,GPT-6开真车考过了科目二!

刚刚,GPT-6开真车考过了科目二! 新智元
2026-09-25
5

新智元报道  


大模型首次通过真车「科目二」考试。

未经驾驶训练的GPT-6 Astra被接入真实丰田卡罗拉,自主完成绕桩及泊车任务。同场测试的Claude Fable 5.1、Grok 4.6及GPT-5.6 Sol均告失败,Astra成为唯一通关模型。

方向盘自动旋转,由大模型实时控制

在DrivingBench测试中,Astra于第二次尝试时跑完全程,耗时5分22秒。

DrivingBench成绩榜:Astra第二把跑完全程,用时5分22秒

特斯拉依托120亿英里数据训练自动驾驶能力,而通用聊天模型在未接受专项训练的情况下亦触及该门槛。继2004年DARPA无人车挑战赛后,时隔22年,首个通用大模型成功将真车驾驶至终点。



无驾驶经验模型直测真车


参与测试的四款通用大模型此前仅用于代码编写、文档处理等任务,均未接受过驾驶训练。

测试结果令职业规划机构80000 Hours联合创始人Benjamin Todd感到意外。


此次测试名为DrivingBench,由三位湾区研究人员发起。测试车辆为租赁的2022款丰田卡罗拉,外挂价值999美元的comma four设备运行开源辅助驾驶系统openpilot,可接管车辆转向、油门及刹车。

测试用车:2022款丰田卡罗拉

车载笔记本运行大模型,方向盘依指令自动转动

各模型通过聊天窗口进行云端驾驶决策。Astra与Sol使用Codex,Fable使用Claude Code,Grok使用Cursor。模型与车辆间通过MCP接口通信,获取双路摄像头画面、车速及方向盘角度信息,输出转向幅度、速度及时长指令,并具备紧急制动功能。

每条指令需附带约30词的决策说明供人类研究员审核。整套系统依赖手机热点维持云端模型与实车通信。

模型在聊天窗口下达指令,右上角显示实时画面

系统架构:模型位于云端,车辆在停车场,通过手机热点连接

车辆不会等待模型推理完成。

模型云端思考期间,车辆仍按上一指令行驶。

多机位记录测试过程,驾驶员全程未触碰方向盘

测试场地为湾区某停车场,经AI智能体分析卫星地图选定。赛道呈倒U形,全长约130米,通道宽8米,终点设7×5米停车位。最高限速3.5米/秒,安全员随时准备人工干预。

每个模型有三次测试机会,共享同一对话上下文。失败后会收到固定反馈提示进行反思,类似驾校教练指导。




Astra拒考后补考满分通关

唯一通关的Astra表现出显著的安全对齐特征。初始阶段拒绝执行驾驶指令,声称不能操控真实车辆。

研究员多次解释安全措施后,Astra仍坚持拒考。



当服务器名称改为「DrivingBench Sandbox」(沙盒环境)后,Astra不再拒绝执行指令。研究人员推测这可能与模型的评估意识或对特定术语的偏好有关。

Astra首次测试因过早判断车身对齐导致偏离赛道,成绩49%。复盘时承认过度依赖画面中心区域,未充分考虑车辆整体宽度。

第二次测试中,Astra将弯道及花坛附近车速控制在0.5-0.8米/秒,频繁微调方向并持续观察路况。最终准确停入车位,耗时5分22秒,行驶134.7米,成为全场唯一完成泊车的模型。

Astra首试:过弯后向左偏离赛道



Astra末段平稳驶入蓝色锥桶围成的车位



其余模型均因误判锥桶失败

Sol与Grok三次测试均在第一个弯道失败,Fable前两次同样失利。三者共同问题在于无法正确识别锥桶边界。

四模型行驶轨迹对比:紫色Astra,橙色Fable,黄色Sol,黑色Grok

三款失败模型均存在锥桶识别错误。


起始斜排锥桶被多次误判车道方向。


GPT-5.6 Sol

Sol依据颜色判断车道,误将同侧不同色锥桶当作左右边界,试图从中穿过。虽在复盘中认识到错误,但后续测试仍未改善,最佳成绩仅6%。


Sol第二试:试图穿越相邻异色锥桶


Grok 4.6



Grok虽能总结理论错误,但实操中未能及时续接指令,导致车辆在无指令状态下空滑超10秒。三试最佳成绩11%。


Grok第三试红字标注时,车辆处于无指令状态

理论认知与实际执行脱节。

Fable 5.1

Claude Fable 5.1展现出学习能力。

首试方向打反越界;次试过度谨慎,190秒内仅行驶31秒;三试修正边界判断后顺利通过首弯及直道,行进至45%处因右转空间不足停止。虽未完成全程,但进步明显。


Fable第三试:沿正确车道驶入长直道




低速高耗验证通用智能潜力


Astra通关平均时速仅1.5公里,耗时5分22秒,消耗660万token,成本7.74美元。其中模型主动生成仅4678 token,大部分算力用于重读历史对话与图像。折合每英里成本92美元,约为燃油费500倍。






尽管效率低下且成本高昂,此次测试对自动驾驶领域具有标志性意义。传统方案依赖海量专属数据训练,如Waymo投入数百亿美元构建激光雷达与高精地图体系,特斯拉积累近120亿英里纯视觉数据。即便EMMA、Alpamayo 1等模型也需经驾驶数据再训练。




DrivingBench证明未经专项训练的通用大模型可直接实现基础驾驶任务。若此路径成立,特斯拉的数据壁垒或将被削弱,未来自动驾驶能力可能成为通用智能的自然延伸。




知名博主Whole Mars Catalog认为,未来将不再区分自动驾驶模型与大语言模型,统一归于通用智能范畴。

自动驾驶与大语言模型的界限将消失,最终融合为通用智能。



前英伟达数据科学家Bojan Tunguz指出,无需人工干预的自动驾驶本就是通用人工智能的衍生能力。



当前云端大模型控车仍属实验性质,实际落地更可能采用模型蒸馏技术部署于车端。但研究团队确认,前沿模型已具备在低速条件下安全驾驶真实车辆的能力。


2005年斯坦福无人车完成DARPA沙漠赛道,催生Waymo项目;二十余年后,通用大模型以对话交互方式实现真车泊车,标志着自动驾驶技术路线的新转折。


参考资料:

https://www.theregister.com/ai-and-ml/2026/09/24/openais-astra-model-went-for-a-drive-and-no-one-died/5298715


编辑:摩西


秒追ASI
点赞、转发、在看一键三连
点亮星标,锁定新智元极速推送!


【声明】内容源于网络
0
0
新智元
智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
内容 16568
粉丝 0
新智元 智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
总阅读419.7k
粉丝0
内容16.6k