导读
01
自动驾驶技术路线-三个技术层级和对应的技术方案和路线
► 感知端的技术路线:根据感知方案的分类,可分为以激光雷达为主的多传感器路线和纯视觉路线,算法架构从2DNCC到BEV-Transformer
► 决策段技术路线:从规则算法到端到端算法,按照技术架构的不同可分为一段式端到端和分段式端到端
► 执行端技术路线:从传统执行系统到线控执行系统
1.1.自动驾驶技术路线-算法驾构和模型桥理
1.2.自动驾驶技术路线-感知端方案的分类
>感知方案之争:自动驾驶领域的感知方案分类主要用绕传感器配置展开,分别是以激光雷达为主的多传感器路线和纯视觉路线。纯视觉路线主要系以算法突破降低硬件依赖,适合大规模普惠型智驾系统,比如:L3级更多应用于乘用车企业卖车模式,对成本较为敏感。多传感器融合方案以硬件冗余保障安全,适合高阶自动驾驶(L4+)或复杂场景,比如Robotaxi,无人物流这些出了问题会追责运营方的应用,对安全性要求较高。
1.3.自动驾驶技术路线-技术架构的两大流派
技术架构的选择:国内车企的端到端技术路线分为两大流派,分别是一段式端到端和分段式端到端。
“一段式”端到端,特点是感知、决策、规划全流程整合为单一神经网络,数据驱动效率高,但需要海量数据和高算力支撑。优势是能应对未定义障碍物,例如突然滚落的轮胎或异形物体,系统可自主生成避让策略。缺点是黑箱问题突出,调试难度大;算力成本高,例如特斯拉FSDV12训练成本达10亿美元。
“两段式”端到端,特点是感知与规控分阶段处理,模块化设计便于优化和验证。优势是降低开发复杂度,适合数据积累不足的车企快速上车例如小鹏XNGP通过XNet(感知)、XPlanner(规控)、Xrain(认知)三模块协同,实现拟人化驾驶。部分车企(如蔚来)计划逐步从两段式过渡到一段式,通过云端算力提升模型整合能力。
1.4.自动驾驶技术路线-规控的算法架构的重大变革
第二次变革:从规则算法到端到端算法
2023年8月,马斯克在直播中首次提到了端到端算法(End-to-End),即把输入(传感器数据)直接到输出(车辆控制信号)的映射,通过神经网络来处理感知,决策控制任务,减少对人工规则代码的依赖。最开始特斯拉只是将决策层的规则代码都替换成神经网络,直到2023年12月,,特斯拉发布的FSDV12,取消了大约30万行传统的C++规则代码,完全依赖神经网络进行决策,实现了感知和决策层的端到端。
端到端的优势在于减少了每个层级之间信息的损耗,减少人工成本和算力,还能提升算法自主学习能力。但端到端也有存在一些缺点,比如可解释力差(出了问题较难判断是哪个层级出现问题),且落地难度大(需要海量真实数据训练)。
端到端算法逐渐形成两大落地形式:分别是显示端到端和隐示端到端。1)显式端到端将原有的算法模块以神经网络进行替代并拼接成端到端算法,是早期量产玩家最青睐的方向,代表的企业有华为、小鹏的分段式端到端。2)隐式即为采用单一神经网络,全流程采用一个多模态基础模型完成的一段式端到端,代表企业为特斯拉、Momenta、商汤科技。
1.5.自动驾驶技术路线-规控的算法架构的重大变革
1)显式端到端(模块化端到端)
技术特点:将系统拆分为感知、决策、规控等可独立优化的模块化模型,保留中间结果输出(如障碍物检测、路径预测),提升可解释性。出现故障时,也能在一定程度上进行白盒化调整找到具体的问题。对于算法团队来说可以最大限度的继承此前模块化的算法和开发能力,同时又具备端到端的算法优势。
代表企业及事件:
华为:2024年9月推出乾崑ADS3.0,采用“GOD通用障碍物识别网络+PDP预测决策规控网络”双模块架构,分别作为系统的眼睛和大脑,实现车位到车位的城市无图智驾。
小鹏汽车:2024年5月 20 日小鹏汽车发布了其由 Xnet、XBrain、Xplanner 构成的端到端自动驾驶方案,分别作为系统的眼睛,大脑,小脑,于2024年7月推送XOS 5.2.0版本,实现“全国不限城市、路线、路况”的XNGP覆盖。
2)隐式端到端(整体端到端)
技术特点:单一神经网络直按输出控制信号(如转向、油门),无中间模块,依赖海量数据实现全局优化,拟人化强但可解释性弱。该方案理论上限更高,但训练囊都和白盒调整也更为困难。现在诸多玩家探索的世界模型(World Model) 也是以该方案为基础做升级。
代表企业及事件:
特斯拉:2022年12月,受ChatGPT启发,马斯克与工程师DhavalShro作启动端到端项目。2024年1月,FSDV12正式版向普通用户大规模推送,成为全球首个量产落地的“纯视觉一段式端到端系统”
商汤绝影:2022年底,商汤绝影联合上海AI实验室、武汉大学发表论文《Planning-oriented Autonomous Drving),首次提出UniAD(Unified AutonomousDriing)架构,将感知、预测、规划全流程整合到单一Transformer模型中,实现真·端到端自动驾驶。2023年,该论文荣获CVPR 2023最佳论文奖,成为全球首个获此奖项的自动驾驶端到端模型研究。
1.6.自动驾驶技术路线-端到端架构2.0
第三次变革:端到端2.0-.生成式AI技术+端到端算法
端到端的玩家:目前海外特斯拉、Wawe,国内包括小鹏、理想、华为、元戎启行、商汤科技、地平线机器人等诸多玩家都提出自己的端到端自动驾驶方案,在算法上端到端已经成为大势所趋。然而,传统端到端仍面临许多难以解决的长尾风险(Comer Case,头部的企业也逐步开始推进端到端2.0的落地。各家开启了对AI生成技术+端到端算法的升级路线,其中特斯拉的Word Model本质是视频生成模型,通过预测未来场景辅助决策。而VLM(如理想DivVLM)则是多模态模型,理解交通语言但无法生成动作。两者都属于生成式AI模型与传统端到端的结合形态。
端到端的算法问题:
1.未知的长尾场景仍无法避免,并非所有的长尾场景都是历史上发生过的,未发生的事件就无法作为数据给模型训练,理论上模型也无法处理相关问题。
2.规则不明确的长尾场景也无法解决,比如潮汐车道,不清楚的交通广告牌,模糊的交通指标等。
解决办法:
特斯拉的世界模型(World Model)特斯拉在2023年CVPR会议首次提及了Wod Model,又在2024年2月Sora横空出世后反复强调他们已经构建出了更加符合物理世界规律的生成式AI。因此,我们推测当前特斯拉采用的端到端模型或已经根据生成式AI技术加入了Word Model来应对未知的长尾场景Worid Model可以1)预测未来,通过构建动态虚拟场景,预测未来几秒的环境变化(如车辆变道轨迹、行人横穿),比如若前方卡车突然掉落货物,Word Model提前生成类似场景训练模型,使系统学会减速避让。
预测未来的能力本质上是让神经网络和人类一样,具备能根据过往经验以及世界的常识来快速判断未来可能发生的事情的能力;2)生成海量的极端题库,Word Model能自动生成百万级极端场景(如动物穿行、暴雨首区),让神经网络在这些生成场景中反复练习,提升应对罕见情况的能力。
双系统的原理:参考人类的思考方式,让模型采用双系统,系统1处理95%常规场景,系统2破解5%长尾问题,人类的思考包含快系统和慢系统,"系统一”是本能反应,条件反射潜意识的;”系统二“是逻辑性的,刻意且缓慢的,在开车时,大部分简单熟悉的道路均由系统一完成,遇到胶难的路段以及危险路段。
系统二会自动上限,人类会动用已有的经验(常识和驾驶知识)来应对极端场景,在自动驾驶中,神经网络通常通过暴力计算一个近似的函数来执行任务,类似于人类的系统一;而大语言模型拥有海量的知识库和超强的学习能力,能够处理复杂多变的任务,类似系统二
1.7.自动驾驶技术路线-2025年展望端到端终极形态VLA模型的落地
VLM已从实验室走向量产车(2024年普及),而VLA正成为2025年头部车企竞逐焦点。随着VLM技术逐渐量产上车,名为视觉-语言-动作的多模态模型Vision-Lanquage-ActionModel(VLA)再次成为各车企的竞争焦点。
VLA可以视作VLM的升级版,相较于VLM,VLA能够执,行动作目拥有更强的推理能力与泛化能力。不少智驾人士都将VLA视为当下端到端方案的2.0版本的终极形态。事实上,VLA模型最早见于机器人行业。2023年7月28日,谷歌DeepMind推出了全球首个控制机器人的视觉语言动作(VLA)模型RT2。2024年10月底,Waymo推出了首个基于端到端的自动驾驶多模态模型EMMA。
1.8.自动驾驶技术路线-自动驾驶技术随AI技术持续发展
》纵观十年来的发展历程,我们不难发现,自动驾驶技术的发展历程与人工智能(AI)技术的进步紧密相连:
2022年年底,ChatGPT的问世,特斯拉再次带领自动驾驶开启端到端1.0时代
2023年,随着OpenAI的GPT-4V发布,谷歌Gemini Robotics首次提出VLA架构,自动驾驶领域正式于2024年开启了端到端2.0时代。
我们认为,当 AI 发展到通用人工智能的时候,完全无人的L5级别的自动驾驶也将能够实现。
02
自动驾驶技术路线-L3和L4技术汇总和对比
L3和L4的技术路径差异:L3与L4级自动驾驶技术在实际落地中呈现出显著的路径分野,其技术选择差异并非源于技术能力优劣,而是由目标场景的安全要求、责任归属和商业化逻辑决定的。L3整体更看重成本和安全的权衡,L4对安全要求第一,成本容忍度相对更高。
L3:在驾驶员在车内兜底的情况下,VLM(E2E+多模态模型)或很多双系统的端到端2.0形式本质是为了让自动驾驶系统开车更像人类,可提升驾驶员的驾驶体验,同时不断提升算法的同时可以降低硬件相关的配置,达到更好的降本效果。
L4:在车内无人的情况下,自动驾驶系统需要承担全责。系统必须在设计域(ODD)内独立处理所有场景,包括罕见极端事件,当前端到端算法形式,仍存在长尾场景覆盖不足,解释性差,黑盒效应等问题。
2.1.自动驾驶的商业模式-L3和L4的发展现状
现状:真L3/L4的里程碑:L3=允许驾驶员脱手脱眼,L4=无监控员的无人化运营。截至2025年6月,当前所处阶段而言,全球高阶自动驾驶行业处于L2+级别规模化落地(真L3未落地)和L4级别限定场景落地(开放道路受限)并行的阶段,L5级别受限于法规和技术,还处在发展早期。
2.2.高阶自动驾驶的商业模式-L3技术和L4技术的变现方式
自动驾驶技术的变现的方式其实可以归纳为:卖产品(L3),卖服务(L4),卖技术(L3&L4),自动驾驶的技术和流量确定主导权。
商业化进展:国内外均为L3/L4双线并行发展状态,受益发展的相关企业如下:
自研主机厂(特斯拉、小鹏、理想、华为系)均从L2+逐渐往上落地L3;
平台运营商(Waymo,萝卜快跑,小马智行,文远智行)推动L4级Robotaxi规模化.技术外溢至限定场景L4自动驾驶,如港口、园区、物流等,因其路线固定或低速特性,具备更高落地可行性。产业链中技术提供商、零部件企业及场景运营方均有望受益
>结论L3:自研车企>华为系>混合L4:Robotaxi(B2C/C2C)>Robovan(B2B)>Robotrunk(B2B)>Robobus(B2C/B2G)
2.3.自动驾驶的商业模式-L3技术由全栈自研的车企主导
L3级:自研车企主导的“技术溢价”模式
>趋势:2025年被视为汽车L3级自动驾驶的商用元年,政策支持、技术突破与成本下降共同推动高阶智驾从高端车型向大众市场普及》受益方向:全栈自研的特斯拉,小鹏,理想
2.4.自动驾驶的商业模式-L4四大场景总概况
四大场景的核心需求系:海内外共同应对劳动力短缺(老龄化,少子化)和安全事故频繁问题。》四大场景中,Robotax(因技术门槛高、替代刚需市场(出行)空间最大,是最值得关注的市场:其次是市场空间大,但技术壁垒低,需要关注成本能力的Robovan市场。市场空间,技术,盈利情况排序如下:
1)市场空间排序:截至2030年,全球来看Robotaxi>Robovan>Robotruck>Robobus
2)技术壁垒排序:Robotaxi(城市复杂路况)>Robotruck(开放场景碎片化)>Robovan(成本敏感度高)>Robobus
3)预计实现盈利顺序: Robotruck(封闭场景)>Robovan >Robotaxi >Robobus
2.5.自动驾驶的商业模式-L4四大场景市场空间和复合增速
》市场空间排序:截至2030年,全球来看Robotaxi>Robovan>Robotruck>Robobus
2.6.自动驾驶的商业模式-L4四大场景技术壁垒
技术壁垒对比:Robobus和Robovan因场景简单,正向低线数激光雷达+纯视觉方案过渡;而Robotaxi和Robotruck因安全要求,激光雷达仍是刚需。激光雷达是否强制,算法和算力的要求也体现了四个场景技术壁垒的差异:
2.7.自动驾驶的商业模式-L4四大场景运营模式
>运营模式分类:
ToC(Robotaxi):靠订单差价赚钱(收乘客10元,成本7元赚3元)
ToB(Robotruck/Robovan):按运输量收费(运1吨货收50元)或租赁费(1辆车月租3000元)To G(Robobus):政府补贴为主(公交公司采购车辆,财政补贴运营亏损
2.8.自动驾驶的商业模式-L4四大场景盈利情况
盈利现状:
载人类(Robotaxi/Robobus)主要做TC生意,靠”拉人"赚车费,但当前用户少、成本高,难盈利;国内Robobus也有部分做To G业务对盈利要求不敏感。
载货类(Robotruck/Robovan)主要做To B生意,靠“拉货“省人工,物流巨头愿买单,封闭场景已赚钱。
盈利优先级:
短期盈利优先级:Robovan>Robotruck(封闭)>Robotaxi>Robobus规模效应核心:车队规模(Robotaxi)、算法订阅量(Robovan)、编队数量(Robotruck)是盈利拐点的核心指标。
03
必争之地Robotaxi-行业生态和中美主导公司
生态:由三个参与方组成,分别为技术提供方,平台运营方,整车提供方2营运模式:总体可分为自运营模式和金三角模式。以特斯拉为代表的自运营模式,企业自购车辆构建车队,收集真实的车辆和用户数据。而越来越多的公司倾向于采用金三角模式,将技术、整车及出行平台的各方资源紧密结合,形成专业化分工与深度合作。
美国“金三角”分工明确·技术主导:Waymo、Cruise等自研全栈技术,特斯拉较为特殊,全环节参与整车代工:捷豹、克莱斯勒提供定制化车辆(无技术主导权)平台导流:Uber/Lyft 纯运营方,无技术能力
中国技术+平台占主导,部分车企积极入股技术平台端技术和平台掌握方:百度,小马智行,滴滴纯技术派:Momenta,元戎启行整车强势方:广汽/上汽积极入股平台端、技术端
3.1.必争之地Robotaxi-萝卜快跑和小马智行已实现单车盈亏平衡
1)日均订单量:盈亏平衡临界值,2025年,萝卜快跑有望实现盈利,小马实现单车盈亏平衡
>行业标准:如祺出行招股书提出,日均订单>15单是Robotaxi实现盈亏平衡的临界点。
>结论:
中企领先商业落地:小马智行通过成本控制(第七代车降本70%)实现订单增长,萝卜快跑借政府合作在武汉快速扩张。
Waymo:虽然订单密度领先(20单/车),但因美国人力成本更高,我们预计盈亏平衡点需延后。
3.2.必争之地Robotaxi-Waymo接近商业化技术拐点
1)接管频率:商业化技术拐点的核心指标,仅Waymo接近商业化技术拐点
行业标准:
商业化技术拐点:加州DMV与百度牵头制定的《自动驾驶出租车》团体标准要求,商业化运营需满足接管频率≤0.01次/千公里(即每10万公里人工干预≤1次)。此标准由百度联合交通运输部等机构于2021年发布,是全球首个Robotaxi商业化技术规范
结论:
Waymo远超同行:其第五代系统通过多模态模型(EMMA)将交叉路口失误率压至0.03%,连续45天无干预运行。
中国企业的瓶颈:极端场景(如夜间低光照、突发障碍物)处理能力不足。(参考来源:西南证券)




