大数跨境

对话纬钛机器人CEO李瑞:具身智能仅靠视觉容易到天花板,触觉是未来必选项

对话纬钛机器人CEO李瑞:具身智能仅靠视觉容易到天花板,触觉是未来必选项 AI科技评论
2026-08-04
2
导读:上触觉已经不是一个「yes or no」的问题,而是「when」的问题。
为具身智能赋予触觉,已不再是“做与不做”的选择题,而是“何时落地”的时间题。

作者丨向欣

编辑丨高景辉

瑞典科学家曾进行一项经典实验:给受试者指尖注射麻醉剂后,要求其从火柴盒取出一根火柴并划亮。正常情况下仅需数秒的动作,在失去触觉后变得极其笨拙:受试者反复调整却拿不稳火柴,划动时用力不均、方向歪斜,耗时良久才勉强完成。

“这就是当前具身智能的真实写照。”纬钛机器人 CEO 李瑞指出。当下的具身智能虽拥有聪明的“大脑”和灵活的“肢体”,却因缺失触觉反馈,如同手指麻木之人,难以执行需要精细感知的操作。

破局的关键在于赋予机器人“接触智能”:使其能像人类一样理解接触本质,不仅感知物体存在,更能依据反馈实时调整动作、控制力度并稳定执行。李瑞认为,仅靠视觉极易触达天花板,下一步必须引入触觉。在人类可执行的 90% 以上任务中,触觉不可或缺。

这一观点与英伟达 CEO 黄仁勋的判断不谋而合:触觉是机器人进入物理世界的最后一块拼图。作为该领域的先行者,李瑞于 2011 年在 MIT 读博期间与导师共同开创了机器人视触觉传感器领域,并于 2014 年推出全球首款分辨率超越人类手指的视触觉传感器。深耕十余年后,他于 2024 年创立纬钛机器人,聚焦视触觉传感器与灵巧操作,并成为小米等头部企业的合作方。

行业共识认为,触觉传感器正处于爆发前夜。李瑞预测,上半年是触觉传感器在灵巧手领域规模化落地的起步期;下半年随着搭载触觉的灵巧手批量出货及数据采集设备铺开,该领域将进入实质性爆发阶段。纬钛定位为“触觉领域的英伟达”,致力于构建涵盖传感器、数采设备、VTLA 大模型和世界模型的物理 AI 基础设施。

这块“最后的拼图”正从论文概念转化为灵巧手上的核心零件。视触觉技术路线壁垒究竟有多深?产业化进程如何?我们与李瑞进行了深入对话。

01 仅靠视觉,如同手部打了麻醉剂

AI 科技评论:产业界对触觉的关注始于今年,而您在此领域已深耕十余年。当初为何选择研究触觉?

李瑞:我自 2005 年本科起便从事机器人与计算机视觉研究,发现单纯依靠视觉远不足以应对复杂操作。基于第一性原理思考,人类操作依赖手眼协同。要实现真正的“心灵手巧”,“心灵”代表智能大脑,“手巧”则不仅关乎自由度,更核心的是触觉反馈。当时市面缺乏优质触觉传感器,现有产品仅能提供单点信息,与人手差距巨大。因此,2011 年我在 MIT 读博时便着手研发视触觉传感器,开创了这一新方向。

当前业界热议的 VLA(视觉 - 语言 - 动作)和世界模型多聚焦于视觉,但仅有视觉远远不够,必须融合触觉信息。

AI 科技评论:在触觉传感器受关注前,业界常用“力反馈”和电流方案控制抓取,这些方案能否替代触觉传感器?

李瑞:过往方案本质多为位置控制,夹爪盲目到达预设位置,却无法确认操作是否成功,缺乏有效反馈。电流方案提供的仅是粗糙的单向力信息,并非真正的触觉。传统力反馈通常针对手腕或手臂,指尖感知长期缺失。

AI 科技评论:真正的触觉传感器能提供哪些关键信息?

李瑞:主要提供两类信息。一是物体的物理属性,如表面纹理、软硬程度、形状大小;二是接触状态,包括法向力、切向力及滑动情况。凭借这些反馈,机器人才能精准判断是否抓牢、抓准物体。

AI 科技评论:特斯拉曾展示灵巧手夹鸡蛋,此类操作是否已应用触觉技术?

李瑞:其使用了较简单的触觉传感器,但缺失切向力。缺乏切向力意味着夹取鸡蛋后,再处理其他物体时难以自适应调整力度。切向力本质即摩擦力。无论是拿水瓶防滑,还是夹鸡蛋防碎,亦或是插拔 USB 时的插入感,均依赖摩擦力感知。若无切向力,精巧操作难以实现。我们的视触觉传感器相比特斯拉前代版本,能提供更为丰富的信息维度。

AI 科技评论:自 2011 年您在 MIT 开创视触觉方向以来,该领域在学术界经历了怎样的发展历程?

李瑞:2014 年是首个里程碑,我们将全球首款超高分辨率视触觉传感器 GelSight 推向市场,其分辨率超越人类手指。2019 年前后,视触觉在学术界引发热潮。原因在于深度学习兴起后,研究长期聚焦视觉,直至 2019 年发现视觉遭遇瓶颈,学界开始转向视触觉研究。

彼时我们已在行业积累多年,实验室屡获最佳论文奖,发表百余篇论文。因此成立公司并非从零开始,依托十余年基础,可快速实现产品化与迭代。

AI 科技评论:学术界认可视触觉后,其在产业端的渗透经历了何种变化?

李瑞:2024 年至今经历三个阶段。2024 年 8 月前,多数灵巧手公司未配置触觉。同年世界机器人大会上,强脑科技和因时机器人率先采用电容方案。经过一年验证,它们开始寻求其他方案。某头部灵巧手公司自去年下半年与我们合作,今年 4 月发布的第三代灵巧手已批量使用我们的触觉传感器。此外,多家头部企业也正与我们展开合作。

AI 科技评论:为何这些公司从电容方案转向视触觉?核心差距何在?

李瑞:传统触觉传感器分辨率不足,每平方厘米仅几十个点,而视触觉可达数万至数十万个点。压阻、电容、霍尔等阵列式传感器受物理结构限制,密度难以提升。高分辨率能为操作提供丰富信息。更为关键的是,切向力对灵巧操作至关重要,视触觉可提供灵敏的切向力(如摩擦力),助力抓取和插拔任务快速闭环,而传统阵列式传感器通常仅能检测法向力。目前行业正向视触觉收敛,对头部灵巧手公司而言,上触觉已是时间问题。

02 摄像头分辨率,即触觉分辨率

AI 科技评论:视触觉为何能突破传统阵列式传感器的密度限制?

李瑞:视触觉灵感源自人手:手指接触物体发生形变,通过神经末梢传递信号。我们利用弹性体模拟皮肤,形变由后方微型摄像头捕捉,再通过算法解算出法向力、切向力等触觉信息。

核心优势在于:摄像头分辨率决定触觉分辨率。我们将触觉信息转化为图像信息再反推,故称“基于视觉的触觉传感器”。

AI 科技评论:这意味着触觉信息点密度取决于摄像头分辨率,而非传感器阵列数量?

李瑞:正确。例如 640×480 分辨率包含 30 万像素点,每个点对应一个触觉信息点。若传感器面积为 3 平方厘米,则每平方厘米拥有 10 万个信息点。

AI 科技评论:除力和形变信息外,视触觉传感器还能采集哪些维度数据?

李瑞:触觉信息以图像形式呈现,包含法向力、切向力及滑动信息,分辨率极高。高分辨率使其能捕捉丰富的表面信息以识别不同材质,同时获取物体在手中的位姿信息。这些数据支持精准回放,适配各类机器人。

AI 科技评论:相比压阻、电容、霍尔等传统路线,视触觉的整体技术优势体现在哪里?

李瑞:具备四大优势。第一,超高分辨率,可达传统传感器的成千上万倍;第二,多维力探测能力,涵盖法向力、切向力及滑动信息;第三,支持柔性物体操作,如衣物、线缆、食物;第四,抗环境干扰能力强,不易受温湿度或电磁场影响,而压阻、电容及霍尔效应易受此类干扰。

AI 科技评论:同为视触觉路线,业内存在多色光与单色光之分,背后的技术差异是什么?

李瑞:学术界主流采用多色光,因其优势显著。多色光可将法向力与切向力分开计算,准确度和分辨率极高。单色光牺牲颜色信息,仅能得到合力,无法有效区分法向与切向分量,导致准确性存疑。至于功耗、算力及耐久性等指标,与光源颜色无直接关联,主要取决于各家技术实力,切勿被误导。

AI 科技评论:这些技术优势如何在产品化中实现?首款标品 GF225 相比学术版本有哪些提升?

李瑞:GF225 相比学术版 GelSight Mini 实现全方位性能跃升,耐久性从千次级提升至 500 万次以上,增幅数千倍,使其适用于工业及商业场景。例如我们与小米的合作初期便采用了 GF225 标品。

随后推出的 GF220 专用于两指夹爪,更轻、更薄、更小,适应狭小空间。此外,今年 3 月在 AWE 发布的 GF515 是全球首款超小尺寸、超高分辨率、超高频率的视触觉传感器,专为灵巧手设计。其每平方厘米拥有上万个触觉信息点,最高频率达 120 赫兹,实现急速响应与低延迟。

03 如果我们踩了 10 个坑,别人可能要踩 100 个

AI 科技评论:拥有学术背景的创业者常面临技术与量产脱节的难题,从学术界到产业界,您感受最深的变化是什么?

李瑞:学术界追求创新性与性能极致,产业界则关注耐久性、稳定性与一致性。例如学术版 GelSight Mini 仅能承受 1000 次按压,而工业级产品需达到 500 万次以上。学术界关注单个传感器,产业界则需确保成千上万个传感器的一致性及其量产能力。

AI 科技评论:许多学术背景创业者在量产工程化上遭遇挫折,你们如何应对?

李瑞:量产与产品化存在巨大鸿沟。从原型到首个产业化版本,我们历经十余年,仍踩过不少坑。若我们踩了 10 个坑,缺乏积累的后来者可能需踩 100 甚至 500 个。诸多细节并未写入论文,如弹性体工艺、结构设计、算法参数调优等,硬件、软件与算法是一个整体,绝非阅读几篇论文或手工制作原型即可掌握。

AI 科技评论:模型厂商反映触觉数据过于丰富,接入训练体系时易混乱,你们如何解决?

李瑞:这恰是视触觉的优势所在。视触觉基于摄像头,数据以图像形式呈现,与视觉模态本质相同,在架构设计上更具优势。在大模型时代,丰富信息更能助力模型捕捉细节,实现精细泛化操作。近期李飞飞团队的 T-Rex 论文也证实,触觉与视觉融合的效果远超纯视觉方案。

AI 科技评论:视触觉数据本质为视频图像,难以大幅压缩,数据存储与算力要求高,这会成为应用瓶颈吗?

李瑞:不会。实际应用无需全分辨率,240×240 甚至 120×120 即可满足需求。五个手指各配 240×240 分辨率,总数据量仍低于一个 640×480 的摄像头。

AI 科技评论:纬钛既做传感器,也做数采设备和模型,未来的定位是什么?

李瑞:我们致力于构建全栈能力,涵盖模型、采集与硬件,并将触觉深度融合其中。定位是“物理 AI 基础设施”及“触觉版英伟达”。该领域由我们开创并持续引领。目前市面上能批量出货且搭载于五指灵巧手的视触觉传感器,唯我一家。

AI 科技评论:你们何时开始布局数据采集设备?

李瑞:始于 2025 年。去年下半年 UMI(通用操控接口)备受瞩目,但其仅为纯视觉方案。应客户需求,我们开发了集成视触觉的 UMI 版本。

在数据处理方面,我们提供清洗与标定服务,采集信息涵盖触觉图像、视觉信息及位姿信息,支持精准回放以适配不同机器人。今年 7 月,我们与光轮智能达成战略合作,将触觉传感器接入其人类数据开放平台,未来采集数据将包含接触位置、形变及滑移等触觉信息。此外,今年 1 月联合国地中心发布的“白虎-VTouch"数据集,下载量已超百万次,正为具身智能补齐触觉数据拼图。

AI 科技评论:灵巧手公司对传感器有哪些具体要求?成本会是大规模覆盖的障碍吗?

李瑞:不同灵巧手对尺寸和性能要求各异,定制适配通常需百台以上起订。今年众多灵巧手公司将部署数千只带触觉的手,若每只手配 5 个传感器,需求量巨大。成本并非最关键因素,功能达标才是前提。早期依赖机加工成本较高,一旦开模批量生产,成本将显著下降。

AI 科技评论:纬钛目前的商业化进展如何?触觉传感器市场何时迎来真正爆发?

李瑞:进展非常顺利。今年是视触觉爆发元年,订单与客户需求激增。据客户反馈,我们是市面上唯一能批量出货五指版本搭载灵巧手的企业。上半年为爆发前夜,下半年将迎来实质性爆发。众多灵巧手将搭载视触觉实现落地,数采设备与整机执行器也将实现视触觉与手眼协同。我们在视触觉多个维度均处于领先地位。

【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容 8883
粉丝 0
AI科技评论 聚焦AI前沿研究,关注AI工程落地。
总阅读207.9k
粉丝0
内容8.9k