当我们第一次去潜水
教练会先教一套水下手势
比划一个OK
表示
“我没事/你还好吗”
手掌平放,掌心向下
左右轻轻摇晃
表示
“有问题/我不舒服”
食指指向耳朵
表示
“耳朵疼/耳压不适”
那么,问题来了
如果教练面对的不是真人
而是水下具身智能设备
比划手势,机器能看懂吗?
在水体中,当潜水员需要水下具身智能设备完成下潜、上浮、调整方向或跟踪目标时,如何自然、快速且可靠地传递任务意图?
手势,确实是最直接的交流方式之一。
但从人的手势到机器人的行动,中间还要跨过重重关卡。一个短暂的识别偏差,就可能变成一次误触发;一个漏掉的指令,甚至可能让整个任务中断。
真正难实现的,不是机器人能不能看懂一个手势,而是机器人能不能理解连续动作背后的真实意图并把它可靠地变成一次行动。
为此,中国电信集团CTO、首席科学家、中国电信人工智能研究院(TeleAI)院长李学龙教授带领团队基于水下具身智能的实际作业工况,构建了一套覆盖手势识别、指令判断和机器人执行的完整水下人机交互系统,实现高可靠的水下手势操控。
潜水员应该如何向机器发出手势指令呢?TeleAI 做了如下考量。
首先,要让人做起来简单。
潜水员背负着厚重装备,水下体力十分宝贵,幅度过大、逻辑复杂的手势,不仅增加体力消耗,也会增加记忆和操作负担。
其次,要让任务真正够用。
水下机器人需要执行的核心任务相对有限,并不需要为每个动作都设计一个手势。一套精简的手势库,只要覆盖核心任务即可。
最后,要让机器能分得清。
手势种类越多,潜在的视觉混淆也越多。即使两个手势在人看来足够简单,它们的手部姿态、角度和形状也可能非常接近,给机器识别带来困难。
基于此,TeleAI 制定了七类核心手势,分别对应:保持、下潜、上浮、目标跟踪、向左移动、向右移动以及上浮出水。
这些手势设计时尽量沿用潜水员熟悉、直观的表达方式,同时避免大幅度身体动作和复杂的手势组合,不仅精简、直观,同时兼顾机器可识别性。
手势做对了,机器就能认出来吗?可没那么简单。
经过对真实连续交互中的完整手势进行识别测试,TeleAI 团队在实验水池和泳池环境中,共进行 186 次手势输入,其中 160 次被正确识别,整体识别准确率为 86.02%。
为什么会出现这些错误?
重要原因之一,是视觉相似性。视觉上越相似的两个手势,越容易被机器人张冠李戴。手势视觉相似度与识别混淆之间存在显著正相关。
假设要命令机器人“上浮出水”。从当前姿势到目标手势,手不会瞬间完成切换,而是会经历一连串变化。这些短暂的中间姿态,可能会在某一帧看起来像另一个手势,从而被机器人误识别。
还有一种更有意思的情况。
“上浮出水”是一个双手手势。潜水员做这个动作时,一只手会先形成与“上浮”相似的姿态,随后另一只手才加入,完成完整手势。而对机器人来说,这个短暂的中间姿态,可能使其断章取义,提前识别成了“上浮”。
这个现象揭示了一个关键问题:机器人真正需要理解的,不只是“你最后摆出了什么姿势”,还包括“你的手是怎么变成这个姿势的”。这也是水下手势交互真正难的地方,水下机器人需要做到的不是识别静态手势,而是理解连续交互中的手势变化。
那么对于水下机器人来说,什么时候,一个手势才算是一条有效指令?
针对这一问题,TeleAI 在“识别结果”和“机器人动作”之间加入了手势到指令的时序交互逻辑。整套机制的核心,就是授权窗口。
潜水员做出“保持”手势,即可打开授权窗口。机器人识别到有效的“保持”手势后,会停留在当前位置,并开启 5 秒授权窗口。只有在这 5 秒内识别到有效任务手势,才会转化为控制指令。指令执行完毕,授权立刻失效,再次开启需要重新比出手势。
简单来说:不是“看见手势就执行”,而是“先确认你要下指令,再执行下一步动作”。这相当于给机器人增加了一层“确认机制”。
实验数据显示,在任务间隔中,直接执行模式下的误触发率(IFTR)为 35.16%;加入“保持”授权后,这一指标下降到 7.69%,降低了 27.47 个百分点。
这层防护,把大量无意动作和瞬时识别错误拦截在了执行环节之外,让水下手势操控变得更加稳妥可靠。
相关工作
Z. Sun, T. Tian, H. Hu, Y. He, M. Shangguan, T. Yu, Q. Yang, M. Chen, X. Wang, Y. Chen, K. Yao, Y. Zheng, Y. Qian, M. Dou, J. Xu, Q. Li, G. Wu, X. Li*, "Extreme-depth Water-related optical imaging: Conquering ultra-low illumination environments from epipelagic zone to Mariana trench," PhotoniX 7, 7 (2025).
Z. Sun, X. Li*, "Water-related optical imaging: From algorithm to hardware," Science China Technological Sciences 68(1), 1100401 (2025).
J. Shao and X. Li*, "AI Flow at the Network Edge", IEEE Network, vol. 40, no. 1, pp. 330-336, Jan. 2026, doi: 10.1109/MNET.2025.3541208.
H. An, W. Hu, S. Huang, S. Huang, R. Li, Y. Liang, J. Shao, Y. Song, Z. Wang, C. Yuan, C. Zhang, H. Zhang, W. Zhuang, X. Li*. "AI Flow: Perspectives, Scenarios, and Approaches", Vicinagearth 3, 1 (2026).


