当摄像头自己长出"深度感"
一台普通RGB摄像头,一台没有激光雷达的电脑,能不能实时构建出它看到的三维世界?这件事过去很难。3D重建的传统路径要么依赖深度传感器(结构光、ToF、激光雷达),要么需要离线处理——先把视频传完,再花几小时甚至几天跑SfM(运动恢复结构)或NeRF(神经辐射场)。实时、单目、纯RGB、万帧稳定——这四个条件凑在一起,就是一个技术难题。
2026年4月,蚂蚁集团旗下具身智能公司Robbyant正式开源了LingBot-Map,一个前馈式3D基础模型,专门解决"边看边建"的问题。输入一段普通RGB视频,模型逐帧预测相机姿态和深度图,实时输出3D点云。不需要深度传感器,不需要离线处理,在518×378分辨率下跑到了约20FPS,且能在超过10000帧的长序列上保持稳定。项目开源即爆火,GitHub上已获得12.6k星标,在3D视觉开源项目中属于热门级别。
传统的3D重建路线大致分两类。一类走离线优化路线(如COLMAP、NeRF),把所有帧一起处理,全局优化对齐,精度高但速度极慢。另一类走增量SLAM路线(如ORB-SLAM),逐帧处理但误差随轨迹延长不断累积,跑几千帧就漂移。LingBot-Map走的是第三条路——前馈式流式推理,把3D重建从"先录后建"变成了"边看边建"。
流式3D重建到底难在哪
3D重建的核心困难在于"记忆"。摄像头在空间中移动时,每一帧新画面都只看到场景的一小部分。模型需要记住之前去过哪里、看到了什么,才能把新帧的信息融合到完整的3D地图中。
传统方法大致分两类。离线优化方法(如COLMAP、NeRF)把所有帧一起处理,用全局优化做对齐,精度高但每处理一段新视频都得从头跑一遍,根本做不到实时。增量式方法(如ORB-SLAM)逐帧处理,但误差会随轨迹延长不断累积,跑几千帧后就漂移到不知道哪里去了。
LingBot-Map用了一个不同的思路:不追求记住每一帧的细节,而是学习一种适合持续更新的"几何上下文"状态。模型内部维护三类记忆,分别对应场景的全局坐标、局部几何和历史轨迹,每一帧只更新必要的部分,把单帧计算量控制在常数级别。
几何上下文Transformer(GCA)
LingBot-Map的核心创新是一种叫几何上下文注意力(Geometric Context Attention, GCA)的机制。它不只是一个单一的记忆模块,而是由三种互补的上下文组成。
第一种是锚点上下文(Anchor Context)。这是整个场景的坐标基准和尺度参考——相当于问"这个世界有多大、原点在哪"。锚点一旦建立,后续所有帧的相机姿态和深度估计都基于这个统一坐标系,从根本上消除尺度漂移。
第二种是姿态参考窗口(Pose-Reference Window)。这是最近的若干帧构成的一个局部窗口,窗口内的帧之间做稠密的几何关联。相邻帧之间通常有较大的视觉重叠,在这个窗口里做局部优化,可以精确估计相邻帧之间的相对位姿变化。
第三种是轨迹记忆(Trajectory Memory)。这是全量历史被压缩后的紧凑表示,每帧只保留少量关键token。当模型需要回忆"十分钟前经过的那个走廊"时,不需要回放所有帧,只需要从轨迹记忆中检索压缩后的线索。
这三种上下文通过可学习的注意力机制协同工作。当前帧的特征从DINO视觉骨干网络提取后,交替经过帧间注意力和GCA层,在GCA内部与三种上下文交互,最终由任务头预测相机姿态和深度图。
20FPS万帧稳定:前馈式推理的效率红利
LingBot-Map之所以能做到20FPS和万帧稳定,核心原因在于它的推理方式是前馈式(feed-forward)的,而不是迭代式。
传统增量方法每一帧都要做一次局部优化,计算量随已处理帧数线性增长。LingBot-Map每帧只做一次前向推理——特征提取、几何上下文交互、任务头预测——单帧计算量基本恒定,与已有多少帧无关。
模型还使用了分页KV缓存(paged KV cache)技术,通过FlashInfer库实现高效的分页内存管理。当处理超过3000帧的长序列时,可以切换到滑动窗口模式,进一步降低显存压力。支持CPU卸载和帧降采样来适配不同硬件。
在提供的三个模型变体中:lingbot-map-long针对长序列和大尺度场景优化,lingbot-map是论文使用的均衡版本,lingbot-map-stage1为第一阶段训练检查点。用户可以根据场景需求选择。
交互式可视化:边建边看
LingBot-Map内置了一个基于viser的交互式3D浏览器。运行演示脚本后,在浏览器中打开http://localhost:8080,就能实时看到模型正在构建的点云。
演示场景包括法庭(courthouse)、大学(university)、环路(loop)和牛津(oxford)四组预置数据。模型逐帧读入图像,在浏览器中逐帧渲染出重建的点云。可以旋转视角、调整点大小和密度阈值。对于户外场景,模型还能自动调用基于ONNX的天空分割器,去除天空区域以减少噪声。
对于需要在无头服务器上生成视频的场景,也提供了离线渲染管线,可以生成纯点云的MP4飞越视频。
不用深度传感器的真正价值
LingBot-Map在技术上的突破之外,还有一层更实际的意义:它把3D重建的门槛降到了只需要一台普通RGB摄像头。
深度传感器有精度高的优势,但也有明显的局限。结构光在户外阳光下失效,ToF在远距离精度下降,激光雷达价格昂贵且功耗高。一台消费级摄像头在任何光照条件下都能拍摄——手机摄像头、行车记录仪、监控摄像头、无人机相机——这些设备数以亿计,但绝大多数没有深度传感器。
LingBot-Map让这些设备具备了3D重建能力。这意味着机器人可以从普通的视觉传感器中构建环境地图,AR设备可以用后置摄像头扫描空间,无人机可以基于RGB视频做实时三维测绘。对于具身智能来说,这意味着视觉感知的成本门槛大幅降低——不需要为每一台机器人配备激光雷达。
项目还提供了一套完整的交互式可视化工具。基于viser构建的浏览器端3D查看器,在运行过程中可以实时看到点云的逐帧构建过程,支持视角旋转和点云参数调节。对于户外场景,内置基于ONNX的天空分割网络自动识别并过滤天空区域,减少点云噪声。
评测表现:超越主流方法
在多个公开基准上,LingBot-Map的表现超越了现有的流式方法和基于迭代优化的方法。
相机姿态估计方面,在Tanks & Temples和Oxford Spires等数据集上,LingBot-Map的流式姿态估计与真实轨迹的偏差小于甚至超过了部分增量SLAM方法。在长序列场景中,其零漂移优势更加明显——即使超过10000帧,轨迹估计的累积误差仍保持在很低的水平。
3D重建质量方面,基于预测深度图融合的点云密度和完整度均达到领先水平。得益于前馈式架构,LingBot-Map避免了迭代优化方法在多帧融合中常见的伪影和空洞问题。
模型在不同场景类型上都表现稳定——室内房间、室外建筑、无人机航拍、驾驶场景——展示了作为3D基础模型的通用能力。
在相机姿态估计方面,在Tanks & Temples和Oxford Spires等数据集上,LingBot-Map的流式姿态估计与真实轨迹的偏差小于甚至超过了部分增量SLAM方法。在长序列场景中,其零漂移优势更加明显——即使超过10000帧,轨迹估计的累积误差仍保持在很低的水平。
安装与使用
LingBot-Map的安装和使用非常简洁。创建conda环境后,通过pip从GitHub直接安装即可。模型权重从HuggingFace或ModelScope自动下载。项目依赖PyTorch 2.8.0,推荐安装FlashInfer加速库以获得最佳性能,如果不支持则回退到SDPA。
核心参数包括关键帧间隔控制KV缓存内存,设置为--keyframe_interval 2时每帧只存一帧作为关键帧,大幅降低显存占用。滑动窗口模式适配超过3000帧的长序列。天空遮罩开关自动过滤户外天空区域。如果显存不足,可以使用--offload_to_cpu配合--num_scale_frames 2减少激活值峰值。降低--camera_num_iterations可进一步加速。
项目提供了完整的交互式Demo,支持单张图片序列输入和视频文件输入。输出包括相机姿态JSON、深度图、3D点云和可选的可视化视频。
Robbyant的3D基础模型路线
LingBot-Map是Robbyant在3D视觉领域的重要布局,但不是唯一的产品。Robbyant还开源了LingBot-Vision(视觉感知)、LingBot-Depth(深度估计)、LingBot-Video(视频理解)、LingBot-VLA(视觉语言动作模型)、LingBot-VA(视觉动作模型)和LingBot-World(世界模型),构建了一个从感知到决策到执行的完整具身智能模型矩阵。
作为蚂蚁集团旗下的具身智能公司,Robbyant的目标是构建可泛化的世界模型,让机器理解物理世界。LingBot-Map解决的是其中关键一环——从RGB视频中实时理解三维空间结构。它与LingBot-Depth配合可以实现从深度感知到空间建图的闭环,与LingBot-VLA结合则能为机器人提供端到端的视觉空间理解能力。对于正在做机器人导航、AR/VR空间扫描、无人机测绘、自动驾驶感知的团队,LingBot-Map提供了一个Apache 2.0开源、拿来即用的选择。
核心配置单
- • 发布:2026年4月 | Robbyant(蚂蚁集团具身智能公司)
- • 模型:LingBot-Map | 参数:前馈式3D基础模型
- • 架构:几何上下文注意力(GCA)+ DINO视觉骨干
- • 输入:普通RGB视频 | 输出:相机姿态 + 深度图 + 3D点云
- • 性能:~20FPS @ 518×378 | 10000+帧稳定
- • 模型变体:lingbot-map-long / lingbot-map / lingbot-map-stage1
- • 开源许可:Apache 2.0

