大数跨境

被质疑「容易复制」的视触觉,到底难在哪?

被质疑「容易复制」的视触觉,到底难在哪? AI科技评论
2026-09-11
8
导读:对视触觉的许多质疑,并不中肯。
对视触觉的许多质疑,并不中肯。

    作者丨向   欣

    编辑丨高景辉

在 3C 产线上,让机器人将 USB 线插入毫米级接口,难点往往藏在视觉盲区。插接是否到位、是否存在卡滞、力度如何把控,答案皆取决于指尖与工件接触的瞬间。
精密装配、柔性物体抓取及插拔等任务,是自动化产线中价值最高且最难被替代的工序。这些曾依赖老师傅手感的环节,正将触觉技术推向具身智能的舞台中央。
视觉解决「看到了什么」,触觉解决「碰得怎么样」。VLA 模型在真实任务中屡遇瓶颈后,业界逐渐达成共识:仅靠视觉感知存在性能天花板,核心短板在于缺失触觉信息
有具身智能厂商创始人比喻:若让人失去触觉三天,连抓杯子都难以掌控力度,生活将陷入混乱。
在触觉赛道中,视触觉已成为热度最高的分支之一,高端灵巧手几近将其视为标配。
资本随之涌入,多家视触觉厂商今年完成大额融资戴盟机器人两月内完成亿元级 A 轮及蚂蚁集团领投的战略融资;一目科技7 月完成超 10 亿元 E 轮融资,投后估值超百亿元千觉、纬钛亦获亿元级融资。
然而热度背后争议并存。有人认为视触觉仅是「摄像头 + 硅胶」,易复制且难做薄;有人担忧光学结构导致帧率受限,或大量视觉数据带来算力、存储及功耗压力,且柔性表面难以适应工业场景的长期使用。
事实上,不少争议已与实际进展脱节,甚至演化为对技术路线的误解。成本、厚度、一致性、耐久性及数据融入模型体系,确是当前待解难题,但拆解原理、产品、数据至落地全链路后会发现,市场诸多判断已滞后于产品迭代速度
带着「视触觉究竟走到了哪一步」的疑问,我们与戴盟、一目、纬钛、千觉、模量等厂商深入交流,梳理产品参数与技术生态,试图还原那些被简化、误读或低估的关键环节。

01


视触觉的底牌:把触觉变成图像

视触觉原理并不复杂:传感器表层为透明弹性体,内部集成光源与微型相机。物体按压导致凝胶形变,形变转化为明暗图案,相机采集图像后,算法重建接触几何、力分布与滑动状态。
将触觉转化为图像,是该技术路线的核心逻辑。
该路线起源于 MIT。2009 年,MIT CSAIL 的 Edward Adelson 团队提出 GelSight,最初仅用于观测物体表面微观形貌,尚未涉及机器人应用。
GelSight
2014 年,团队推出全球首款超高分辨率指尖 GelSight 传感器,首次将视触觉装上机器人指尖。该论文第一作者李瑞,后来回国创立了纬钛机器人
全球首款超高分辨率指尖 GelSight 传感器
2020 年,Meta 开源 DIGIT 触觉传感器全套硬件设计,大幅降低科研门槛;2021 年 Meta 与 GelSight 合作推进量产商业化。至此,视触觉进入全球实验室并衍生出 OmniTact 等变体,光学路线逐渐成为主流。
针对「没有自有算法」的质疑,实际上,虽然光度立体法源自计算机视觉,但 GelSight 将其与弹性体反射涂层、多角度可控照明深度结合,形成了高分辨率几何重建范式。后续针对凝胶非线性、剪切力解耦、标记点跟踪的定制改进,均围绕触觉物理特性展开,并非简单套用视觉算法。
关于表面油污影响图像的担忧,实则传感器光学腔体封闭,相机向内拍摄,油污无法进入内部污染镜头。
污染真正影响的是凝胶表面的力学与光学耦合特性,可能改变局部变形进而影响精度与寿命。这与压阻、电容等软体方案面临的表面材料工程问题类似,并非视触觉独有的原理缺陷。
回归价值本质,传统触觉传感器通过离散感知单元获取压力或形变,感知点密度受物理器件限制。而视触觉的信息点密度由相机分辨率决定,这是其最突出的优势。
纬钛机器人创始人李瑞介绍,640×480 的图像包含 30 万像素点,若传感器面积为 3 平方厘米,每平方厘米可达上万个触觉点
一目科技创始人李智强对比指出:人手指尖约 1.2 万个触觉点,一目产品可达 24 万个,远超人手。相比之下,传统压阻式传感器每平方厘米仅几十个点,电容、霍尔方案也在百个上下。
在感知维度上,视触觉同样优势显著。李瑞概括其三大优势:能同时测量法向力、切向力与滑动,能操作衣服、线缆、食物等柔性物体,且不受温湿度与电磁场干扰
「最类人」是业界共识,视触觉与人类感知能力最为接近有厂商认为,这条路径将是触觉传感器的终极方案。

02


走上牌桌的厂商

视触觉热潮下,玩家日益增多。专业厂商中,国外有 GelSight,国内包括戴盟机器人、一目科技、纬钛机器人、千觉机器人、模量科技、叠动科技、知行具身;另有Sharpa、曦诺未来、拾玥科技等灵巧手厂商选择自研。
各家公司背景各异:GelSight 与纬钛源自 MIT,戴盟孵化自港科大,千觉创始人是上海交大副教授,叠动核心团队来自港科大,一目从光谱芯片业务转型,模量创始团队来自香港城市大学、厦门大学等高校。
这些厂商呈现出几个明显共性。
其一,纷纷向系统级公司演进,产品边界超出传感器本身,向上游数据采集、底层算法平台及数据集、末端执行器延伸,试图打造系统级能力闭环。
戴盟、一目、千觉、纬钛均布局了数采设备、数据集与模型,模量发布数采手套,成立最晚的叠动也推出了集成算力的夹爪。
全栈化趋势背后有两方面原因。一方面,尚未成熟的环节是潜在增长点。千觉联合创始人赵浩南解释,传感器、数据、模型环环相扣,在硬件或模型未完全成熟前,接口地带即是机会。
另一方面是行业早期阶段使然。一目科技创始人李智强判断这是「先全栈、后分工」的过渡阶段;戴盟方面也表示,全栈非最终目的,适合合作的部分将交由专业厂家,但触觉数据处理链路与模型能力必须自建。
其二,产业资本密集入场
戴盟股东涵盖汇川技术、中国移动、中国电信、蚂蚁集团、联想、招商局创投;一目背后有小米系顺为资本、TCL 与博世旗下博原资本;纬钛天使轮由小米战投领投,Pre-A 轮有韦尔股份旗下韦豪创芯;千觉天使轮由智元机器人领投,理想汽车、吉德电器随后加入。
股东名单显示,家电与消费电子产业方出镜率最高。小米系、TCL、松霖、吉德等纷纷入局,因家电产品迭代快、型号多,产线需机器人适应多变环境,而插接、装配、抓取等任务高度依赖接触反馈;车企、半导体产业方看中精密装配,蚂蚁、联想等大厂则押注数据与生态。
落地场景上,各家聚焦高价值工序:戴盟在 3C 产线承担 USB 插拔、标签张贴;纬钛与小米及多家世界 500 强合作;千觉已服务 300 多家头部客户,夹爪类产品去年量产,订单量级达千套至万套。
其三,不少产品补齐了防水防尘能力,帧率基本达到百 Hz 级别
戴盟传感器达到 IP67 防护,通过 500 万次按压与 20 万次摩擦测试;纬钛夹爪款具备 IP54 防护且可升级,工作温度覆盖 -25℃至 80℃;一目 Sentra T0 系列达到 IP65 防护,工业寿命超五百万次按压;千觉正在研发防水款。
千觉机器人联合创始人赵浩南解释,研发防水款是为了适应机器人进入家庭后的真实需求,如洗碗、洗水果、拿抹布等涉水任务,均要求传感器在水环境中正常工作。
防尘更多基于工业场景需求。总体而言,防水防尘旨在延长凝胶寿命与保持标定长期有效
戴盟视触觉传感器
行业中「视触觉帧率仅 30 到 60 fps」的说法已过时。戴盟夹爪款达 120 Hz、灵巧手款 180 Hz,千觉最高 150 Hz,模量工业夹爪 120 Hz,叠动甚至将全系采样频率拉至 400 Hz 以上。
其四,产品形态多样,并已出现不少曲面产品。仿生曲面曾被视为难题,如今视触觉传感器已能做到接近指腹形态。一目拥有方形、楔形与指尖三类形态;千觉的精灵为仿生指尖,夸克 N1 与 W1 为仿生曲面,光子为楔形平面。

03


格局未定,各有各的解法

厂商增多引发同质化质疑,甚至有观点认为电商平台买齐零件即可手搓产品。但实际上,开源方案虽降低入门门槛,商用产品对凝胶配方、光学校准、批量一致性、可更换设计与软件栈要求极高,这些环节决定产品能否走出实验室。取舍不同,产品亦不同。
评判视触觉传感器可关注以下几个方向:
  • 空间分辨率与深度精度决定能识别多细的纹理与形变,直接影响对芯片引脚、头发丝分叉等表面特征的识别能力;
  • 力感知性能包括法向力、切向力、力矩的测量范围与精度,决定能否感知滑动、判断抓取稳定性,其中切向力尤为关键;
  • 帧率与延迟影响动态操作响应速度,高频操作(如装配、插拔)需要百 Hz 级别的实时反馈;
  • 尺寸与集成性决定能否嵌入灵巧手指尖、适配不同构型的末端执行器;
  • 耐久性与环境适应性决定产品在产线上的使用寿命,包括防水防尘等级、按压寿命、抗穿刺与抗腐蚀能力。
盘点市面产品参数发现,行业参数标注并不统一,横向对比虽有难度,但仍可从各家强调的指标看出打法差异。
戴盟聚焦耐用性和一致性。产品具备 IP67 防护,防水防溅、抗尘耐污,抗电磁干扰能力强,特别标注灵敏度、零漂、输出时漂、非线性等指标,传感器表面可承受划、刺、刮等操作。
这很大程度上得益于材料工艺。传感器由外层保护层、中间透明层及贴合工艺等多层结构组成,每一层均针对实际使用场景调整。
一目最突出的标签是,靠自研超表面硅光感光芯片压缩光路,将产品压至 10 毫米以内,第二代做到3 毫米
一目科技视触觉传感器
一目科技相关负责人介绍,团队多名核心成员有华为背景,优势在于强大的工程化能力。据披露,今年已拿下多家行业头部客户订单,应用于灵巧手的仿生指尖款触觉传感器已开启量产。
千觉在参数上强调一致性和精度表现,全系带自标定算法,自动校准保障片间稳定,整手触觉方案中跨传感器一致性超过97%;对产品合力精度、变形场精度标注细致。
纬钛的产品明显体现面向场景的取舍,夹爪款采样频率相对低但工作温度范围宽,指尖款频率高、面向 0 到 50℃环境;GF225 的法向力与切向力量程均达 30 N,在公开标注中最高。
模量走视触觉与压阻多技术融合路线,以视触觉做指尖高精度,以压阻做手掌大面积覆盖。
知行具身切换感知范式,将相机换为事件相机:只检测亮度变化区域,变化即输出,绕开传统视触觉「逐帧快照」的物理限制,减少大量重复图像数据输出,带宽小且无需外挂算力设备。
叠动则将 MEMS 工艺引入视触觉,全系采样频率拉至 400 Hz 以上,在频率上形成差异化。
技术生态上,各家虽都在全栈化,但具体路径存在差异。
戴盟是目前技术生态布局最完整的厂商,从传感器到数据采集设备、数据集、评测基准,再到VTLA 模型、世界模型均有布局。
模型方面,戴盟 2024 年率先提出 VTLA(视觉 - 触觉 - 语言 - 动作)架构,近期又发布触觉锚定世界模型 Daimon-TWM。
数据方面,公开数据集的有四家:戴盟的 Daimon-Infinity 是全球最大规模含触觉数据集,并开源其中 1 万小时数据;千觉的 TacVerse 1k 是首批 1000 小时真实交互数据;纬钛的白虎-VTouch 超 6 万分钟,强调跨本体;一目联合斯坦福推进开源项目 TouchNet。
此外,一目着力于降低模型厂商使用触觉数据的门槛触觉基座负责采集,Tactile Transformer Encoder 将不同硬件采集的原始信号编码成与视觉、语言对齐的通用表征,让基模开发者无需理解底层细节。
仿真探索方面亦有不同:戴盟将仿真能力用于评测,与银河通用联合发布评测基准 RobOmni,意在定义行业标准;一目自研触觉仿真平台;千觉发布全球首个触觉仿真工具 Xense_Sim,填补切向力模拟空白;纬钛与光轮智能合作,将传感器数据接入人类示教平台,记录轨迹之外的手感数据。
厂商选择各异,行业对「触觉该长成什么样」尚无标准答案。

04


落地之前,还有几道坎

关于应用节奏,业内共识是装上视触觉传感器的夹爪会先行。夹爪装上机械臂即可使用,控制难度低于灵巧手,补上触觉即补齐了抓取闭环的关键拼图。
灵巧手因构型各异,对传感器形状与曲率要求不同,这种高度定制化需求也是部分厂商选择自研的原因,以便更快内部迭代。
不过,各厂商均表示灵巧手款传感器正进入量产阶段。一只五指灵巧手所需传感器数量远多于两只夹爪,需求爆发后出货量可观,但视触觉仍需跨越几道关卡。
第一道坎是成本和厚度。国外代表产品 DIGIT 售价约 355 美元;有灵巧手厂商透露,国产夹爪型视触觉传感器单价一千多元,指尖型三四千元,一只整手仅视触觉传感器成本就可能上万
厂商态度比较一致:先解决性能,再谈成本产品成熟后,规模化过程自然会降本
价格区间正在拉平。戴盟透露,其视触觉传感器无论夹爪款还是指尖款,单价均在一千多元。
另一方面,视触觉的成本需换个算法,应拉长至整个生命周期来看。戴盟相关负责人介绍,视触觉是唯一表面材料可替换的技术方案。其他方案花 500 元买传感器,三个月坏了再花 500 元换新;视触觉虽然初始成本高,但表面损坏后,后续只需几十元换一片硅胶即可继续使用
一目科技透露,自家视触觉传感器已进入可规模化量产的成本区间,降本主要得益于自研解算芯片与供应链能力。
厚度是视触觉从实验室进入灵巧手时绕不开的问题,但其进展常被低估。
最初的 GelSight 接近 30 厘米见方的盒子,2014 年指尖版仍有 60 毫米厚,DIGIT 做到 18 毫米。
Digit
如今,戴盟产品已做到 5 到 8 毫米;叠动产品 7 到 9.8 毫米;一目从第一代 10 毫米以内迭代至第二代 3 毫米;知行具身产品最薄仅 3–4 毫米。
「视触觉因为有摄像头所以永远做不薄」的说法并不成立。
厚度问题上,各家解法不同:戴盟靠材料与结构优化,一目用自研芯片压缩光路。至于灵巧手指尖究竟需要多薄,行业尚无共识,多数产品仍在迭代阶段。
第二道坎是一致性与耐用性,这比成本和厚度更重要。
视触觉数据要进入模型训练,前提是同一批传感器对相同输入给出相近读数;一致性差的传感器,采出的数据进模型反而成为噪音。
戴盟从材料、结构和防护入手提升耐用性,千觉用自标定算法解决一致性。一目科技具身产品 PDT 经理周爱第将此归结为系统工程能力:只做好某一个零件不够,材料、光学、算法、制造和标定全部需要协同
「网上买零件就能手搓一个视触觉」的说法,只能说明原理验证门槛不高,却不能说明产业化门槛低。
第三道坎是算力与功耗。
若一只灵巧手上部署多个传感器并持续输出高分辨率数据,算力、存储和通信压力确实会增加。
但工程上并不意味着所有原始图像都必须完整保留。
一目工程师介绍,面对较大数据量,实际使用时通常会先进行下采样,或用轻量级网络(如 ResNet)提取特征,再交给下游模型。
另一种方式是在感知端减少数据量,从源头解决。
李瑞给出的解法是适当降低分辨率,认为 240×240 就够了,甚至 120×120 也行。每个手指 240×240,五个手指加起来比一个 640×480 的摄像头数据量还少。
知行具身改变了成像架构,通过基于定制的微型事件相机模组重构整套传感系统,使传感器在高速感知下仍能保持较低数据率,无需外挂算力盒。
而且,视触觉将几何与力统一在同一个传感器里,比起「力传感器再加一路视觉」的系统,整体链路反而更省力。
真正需要比较的,是增加的计算成本能否换来足够高的任务收益,而非视触觉的数据量大小。
第四道坎,是触觉数据如何融入模型。这或许是行业下一阶段最大的变量。
现在很多 VLA 模型仍然是先把视觉和语言体系做起来,再尝试把触觉补进去。
千觉机器人将这种做法比作补作业:传感器格式不统一,数据融合度不够,多设备延迟不同,延迟越高,长序列任务越容易断裂。
戴盟 2024 年提出 VTLA,把触觉放到与视觉平级的位置,千觉也是类似思路,让触觉作为原生模态,传感器、数据规则、数采设备与模型训练保持同一套体系。
不过,戴盟相关负责人认为,数采硬件本身难度不大,真正的壁垒在数据链路时间戳对齐、多模态打通、后处理管线,决定数据能不能用、好不好用。
这也是触觉数据竞争正在发生变化的原因。
上半年各家还在卷数据集时长,下半年开始有人转向卷质量,厂商开始越来越多地讨论数据质量、一致性、同步精度以及数据能否真正训练模型。正如赵浩南所说,时长再长,质量不够,只会越采越污染。模量科技联合创始人周建林也提到,触觉感知行业的竞争,最终是数据的竞争。
而这件事最终会落到一个现在还没有答案的问题:
训练一个真正能完成灵巧操作的模型,到底需要什么规模的触觉数据?需要包含哪些维度的触觉数据?
目前没人能交出准确答卷,视触觉厂商、具身本体及模型公司都在探索,这是一个需要合力解决的难题。
对爆发时点,乐观者认为今年下半年就会掀起触觉风潮,保守预判是灵巧手明年或后年先放量,触觉传感器随后跟上。
共识在于,视触觉的节奏绑在灵巧手的成熟度上。对厂商而言,眼下要做的事排序清晰:把一致性与耐用性做到位,把数据管线打通,再逐步压低厚度与成本。
每一步都不轻松,但和一两年前相比,方向已经清楚许多。视触觉需要的,其实只是时间,以及更多耐心。
【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容 8946
粉丝 0
AI科技评论 聚焦AI前沿研究,关注AI工程落地。
总阅读239.2k
粉丝0
内容8.9k