在上一篇行业综述中,我们从宏观视角梳理了智驾与机器人视觉相机的行业现状、硬件品类与未来发展趋势。我们知道,相机是感知系统的语义核心,但不同类型相机的成像逻辑、测距原理、硬件架构完全不同。
很多人只知道相机能够采集画面,但不清楚为什么不同方案成本差距悬殊,室内设备偏爱结构光、户外设备多用双目,单目相机需要依靠BEV模型估算深度,而3D相机可以直接获取物体距离。
本篇从底层技术原理出发,系统性拆解机器人、自动驾驶领域四大主流视觉方案:单目RGB、双目立体视觉、结构光3D相机、ToF飞行时间相机。从成像逻辑、技术本质、优缺点、工程取舍、适配场景全方位做底层拆解。
一、2D视觉:单目RGB相机(最基础、量产最大)
1. 核心原理
单目相机成像遵循小孔成像模型。
通过CMOS感光芯片接收环境反射光线,将三维真实场景,投影压缩为二维像素平面。
画面纹理信息完整,但成像过程会丢失深度维度。
单目设备本身无法直接获取物体距离,目前车载、机器人方案里的单目深度信息,全部依靠算法推理实现:结合纹理尺寸、物体遮挡关系、地面几何先验与大数据训练后的AI模型拟合估算距离。
2. 技术优势
结构最简单、成本极低,模组体积小巧,安装适配性强;
分辨率上限高,画面纹理细腻,物体分类、标识识别等语义任务表现突出;
标定流程简单,设备长期运行稳定性高,故障概率低;
常规光照环境下通用性强,适配绝大多数感知场景。
3. 底层天生缺陷
不存在原生深度数据,距离数值依靠模型推算,远距离场景误差明显;
白墙、平整空地、天空等弱纹理区域,深度推理容易失效;
存在尺度混淆问题,容易混淆近处小物体与远处大物体;
无法独立完成高精度避障、三维建图、精准测距工作。
4. 工程适用场景
自动驾驶:前视主摄、侧方补盲相机、环视泊车摄像头;
机器人:纯视觉SLAM、标识识别、环境画面监控;
实际落地中一般搭配BEV深度模型或激光雷达弥补深度短板。
二、2.5D视觉:双目立体相机(机器视觉通用方案)
1. 核心原理
设计逻辑模仿人眼视差原理。
两台参数完全一致、同步触发拍摄的相机保持固定基线间距,同步采集同一帧场景画面。算法匹配左右画面内相同物体的像素坐标,计算像素之间的视差差值,依靠三角几何公式直接换算真实物理深度,不需要借助AI模型估算。
基础逻辑:视差数值越大,物体距离设备越近;视差数值越小,物体距离设备越远。
2. 技术优势
依靠物理计算生成深度,数据可信度高于单目AI估算;
可输出稠密深度图,同时保留RGB纹理与深度两类信息;
属于被动视觉方案,无需主动发射光源,室内外场景均可使用;
无强光红外光源干扰问题,户外环境鲁棒性较好。
3. 核心缺陷(工程痛点)
工作效果高度依赖环境纹理
纯白墙面、纯色地面、大雾天气等低纹理场景,像素匹配点大量消失,深度计算直接失效。算力消耗偏高
需要完成立体校正、逐像素匹配、视差优化整套流程,对嵌入式设备算力有一定要求。标定维护要求严苛
设备震动、镜头热变形、模组松动都会改变基线参数,深度精度会快速下降。
4. 工程适用场景
室外巡检机器人、无人机、户外移动设备;
不允许加装主动光源、追求纯被动视觉的项目;
NAV2室内小车,作为激光雷达之外的辅助定位感知设备。
三、3D视觉:结构光相机(室内测距高精度方案)
1. 核心原理
归类为主动式3D视觉设备。
设备主动向外投射带有固定编码的光斑、条纹或网格图案,光线接触物体表面后发生形态形变。接收相机采集畸变后的图案,结合预设编码规则与三角测距算法,解算出完整的物体三维外形与对应深度数值。
简单理解:设备主动制造人工纹理,即使纯白无纹理环境,也能提供可供匹配的特征点。
2. 技术优势
无灯光黑暗环境下也能稳定完成测距,不依赖环境自然光;
白墙、纯色桌面等无纹理场景可以正常工作;
近距离测距精度可达毫米级别;
输出深度图细节丰富,适合三维重建、精密抓取任务。
3. 硬性短板
设备无法在太阳光环境稳定工作
自然光包含大量红外杂光,会覆盖、冲刷设备投射的编码光斑,户外场景下测距功能直接失效。
除此之外,有效测距距离短,模组整体成本、体积都高于普通双目相机。
4. 工程适用场景
仅适配室内环境
人形机器人机械臂精准抓取;
室内物体三维扫描、场景重建;
人脸识别门禁、室内静态高精度测距设备。
四、3D视觉:ToF飞行时间相机(动态感知低成本方案)
1. 核心原理
同样属于主动式3D视觉。
发射端输出高频调制红外光线,光线接触物体后折返,芯片记录光线发射与接收的时间差、相位差,结合光速参数直接换算物体距离。
不需要像素匹配、纹理分析等复杂运算,依靠光的传播速度直接得出深度。
2. 技术优势
图像帧率高,信号响应速度快,适配高速动态避障;
后端处理算法简单,算力消耗低,适配低端嵌入式硬件;
无光黑暗场景可以稳定运行,不受环境纹理缺失影响;
硬件结构简化,整体采购成本低于结构光设备。
3. 技术缺陷
深度图分辨率偏低,物体细节还原能力弱,仅能识别大致轮廓;
测距精度会随距离增加明显衰减;
多台同规格设备近距离同时工作时,容易出现红外串光干扰;
户外强光环境下,红外信号容易被自然光抵消。
4. 工程适用场景
扫地机器人、仓储AGV近距离快速避障;
算力资源有限的小型嵌入式设备;
近距离人体感应、简易测距场景。
五、四大视觉方案横向对比(工程选型参考)

1. 单目RGB
优点:画面成像效果好,语义识别能力强,采购成本低,设备运行稳定
缺点:无原生深度数据,依靠AI推算,远距离测距误差大
定位:自动驾驶主力感知设备,侧重环境语义识别,搭配BEV模型弥补深度短板
2. 双目立体视觉
优点:被动式物理测距,精度可靠,室内外通用,无主动光源干扰
缺点:低纹理场景失效,算力需求更高,日常标定维护繁琐
定位:户外机器人、无光源限制场景下的高精度纯视觉方案
3. 结构光
优点:室内测距精度上限高,无光、无纹理环境均可正常工作
缺点:太阳光环境完全失效,测距距离短,硬件成本偏高
定位:室内三维重建、人形机器人精密抓取场景专用设备
4. ToF
优点:响应延迟低、算力需求小、黑夜环境稳定,硬件成本可控
缺点:深度细节表现力差,远距离精度不足,多机容易互相干扰
定位:低成本设备近距离动态避障、简易测距场景
六、工程落地最终选型逻辑
侧重语义识别、大规模量产、长期稳定运行,优先选择单目RGB搭配BEV大模型;
户外场景、需要纯视觉原生物理深度,优先选择双目视觉;
室内场景、毫米级高精度抓取与三维建模,优先选择结构光;
硬件算力有限、仅需要近距离快速动态测距,优先选择ToF。
七、总结
2D与3D视觉设备不存在绝对优劣,只存在场景适配的区别。
单目设备的核心作用是识别环境内物体与标识;双目设备负责在户外场景完成可靠测距;结构光设备主打室内高精度三维感知;ToF设备满足低成本、低延迟的近距离测距需求。
高阶自动驾驶、高端移动机器人的成熟方案不会单独依赖某一类视觉硬件,而是采用多类视觉设备互补,搭配激光雷达融合感知,再通过BEV框架统一空间建模,弥补各类相机本身的固有短板,实现全天候、全场景稳定感知。


