2026 最热赛道不是大模型写诗,而是让 AI 长出身体——这 10 个缩写,串起了它从“只会说”到“能动手”的进化路线。
你以为 2026 年的 AI,还是 ChatGPT 在对话框里写诗?
错了。今年最炸的赛道叫具身智能——让 AI 拥有物理身体,能打开冰箱、能煎蛋、能在工厂拧螺丝。但凡你点开一篇机器人文章,就会被一串缩写砸晕:LLM、VLA、WM、VLX……
它们到底是什么、彼此什么关系?今天用一条清晰的进化线,帮你一次搞懂这 10 个“机器人黑话”。看完你会明白一句话:AI 正在从数字世界的聊天工具,变成物理世界的行动主体。
COGNITION
认知内核:机器人“大脑”
LLM:大语言模型,只会读字写字的“原始大脑”
Large Language Model,能吃文本、吐文本的 AI。ChatGPT、DeepSeek、GPT-4 都是它。在机器人里,LLM 是认知内核,负责理解人类指令、把复杂任务拆成步骤——你说“做顿早餐”,它拆成“开冰箱→拿蛋→点火→煎蛋”。但它有个致命缺陷:只认文字,看不见、摸不着、动不了。
MLLM:多模态大模型,给大脑装上“眼睛和耳朵”
Multimodal LLM,能同时处理文本、图像、音频、视频。GPT-4V、Gemini、Qwen-VL 都是代表。它让机器人不仅“听懂”你说什么,还能“看懂”你指着什么——你说“把那个红的拿给我”,它知道“那个”指画面里哪个物体。但 MLLM 仍停留在“看懂”阶段,还不会动手。
PERCEPTION
感知层:让机器人“看懂”
VLM:视觉-语言模型,机器人的“眼睛+大脑”
Vision-Language Model,同时理解图像和文字。和 MLLM 的区别:MLLM 覆盖多模态,VLM 专注视觉+语言两个模态。它是具身智能的感知理解层,负责“看懂环境、听懂指令”,能精准回答“图里有什么、场景发生了什么”。行业硬指标:多模态语义对齐准确率 95% 以上,跨模态响应延迟 200ms 以内。VLM 让机器人“看见了”,但还不知道去哪、不知道怎么做。
NAVIGATION
导航层:让机器人“知道去哪”
VLN:视觉-语言导航,机器人的“导航仪”
Vision-Language Navigation,根据视觉信息+语言指令,在三维空间里规划路径、自主导航。你对着扫地机器人说“去厨房把地上纸巾捡了”,VLN 负责搞懂“厨房在哪、怎么走、路上有没有障碍物”。它是空间导航层,解决“去哪里”的问题:室内自主导航、目标搜寻、动态避障都靠它。工业要求:复杂环境导航成功率超 92%,动态避障延迟不超 100ms,定位精度控制在 5cm 内。VLN 让机器人知道去哪,但还不会动手。
ACTION
执行层:让机器人“动手干活”
VA:视觉-动作模型,最原始的“动手能力”
Vision-Action Model,只靠画面、不需要语言指令,直接从视觉映射出动作。它是 VLA 的前身雏形,解决了 AI“从看到动”的从零闭环:看见零件就抓、看见空位就放、看见障碍就缩。优点响应极快、适合工业固定场景;缺点是没语言理解能力,只能做训练过的固定任务,泛化弱。它是工业机械臂、固定产线的核心模型,也是后来 VLA 的技术基石。
VLA:视觉-语言-动作模型,机器人“大脑+手脚”
Vision-Language-Action Model,把视觉感知、语言理解直接映射成机器人控制动作的统一神经网络,从像素到动作一步到位。它是具身智能最核心的模型,实现“感知-决策-动作”闭环——不光知道“把水果放冰箱”什么意思,还知道机械臂怎么接近、夹爪何时闭合。
💡 划重点:VLA 是当下具身智能的“主战场”,但它有个短板——只做不想,不会预判“用这个力度抓,东西会不会滑落”。
TOUCH
触觉层:让机器人“长出手感”
VTLA:视觉-触觉-语言-动作模型,让机器人“会摸”
Vision-Tactile-Language-Action Model,在 VLA 基础上加触觉感知。视觉告诉“这是什么”,触觉才告诉“多硬、多滑、多弹”——光靠视觉,机器人难应付柔性物料、精密小件。VTLA 能实时感知受力与形变,动态调整施力,实现无预设轨迹的自适应操作。
2026 世界人工智能大会上,千觉机器人用 VTLA 演示了三大实景 Demo:双臂纸盒成型、耳机精密装配、商品真伪鉴定,证明触觉智能已在真实产业落地。
PREDICT
预测层:让机器人“学会想象”
WM:世界模型,机器人的“想象力”
World Model,在机器人脑海里构建外部世界的内部表征,用来预测未来状态。
和 VLA 的根本区别:VLA 是“输入→输出”映射(看见什么做什么),WM 是“先想象再行动”——动手前先预测“这样做世界会变什么样”。它不参与即时执行,而是给各类模型提供可交互的虚拟试验空间。
自变量机器人发布的 WALL-WM 甚至能做到“事件级预测”:不再问“0.1 秒后什么样”,而是直接想象“抓住杯子那一刻什么样”。WM 让机器人从被动反应,升级为主动预判。
FUSE
融合层:让“预测”和“行动”在一起
WAM:世界-动作模型,能想象也能行动的“完全体”
World-Action Model,把环境预测(WM 的能力)和动作生成(VLA 的能力)统一在同一框架。WM 只想象不行动,WAM 既想象又行动;VLA 是反应式(看到什么做什么),WAM 是前瞻式(先预测再行动)。
它是具身智能的下一代理模型,天然具备三项能力:融合视频预训练的物理先验、兼容多源数据、通过反事实推演做长时序预判与零样本跨具身迁移。2026 年 7 月,蚂蚁灵波发布行业首个具身原生世界动作模型 LingBot-VA 2.0;银河通用发布全球首个测试时后训练框架 WAM-TTT,让机器人“看段人类视频就能在新场景上岗”。
ULTIMATE
终极形态:一体化的“超级大脑”
VLX:感知-导航-执行的“三位一体”
Vision-Language-eXecution,VLM + VLN + VLA 的融合体,把感知、导航、执行三大能力整合进一个模型。它不是行业通用标准术语,而是部分厂商对一体化融合架构的命名,目标是让机器人真理解指令、看懂场景、做出精准动作,像人一样思考与行动。Om AI 联汇的 VLX 系列用端侧原生架构,三层模型协同:VLX-Flow 负责流式理解与文本交互,VLX-Seek 负责细粒度视觉感知,VLX-Go 负责具身导航与执行,构建“从看见、看清到自主行动”的全链路毫秒级闭环。
|
|
|
|
|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
THE END
从 LLM 到 VLX 的进化路线
LLM(只会说)→ MLLM(能看懂)→ VLM(专注看)→ VLN(会导航)→ VA(能动手)→ VLA(动手干活)→ VTLA(会摸)→ WM(会想象)→ WAM(既想又做)→ VLX(全能一体)。
「每一步进化都在解决一个核心问题:从只能读字,到能看、能走、能摸、能想、能一体行动。本质就是 AI 从数字世界的聊天工具,变成物理世界的行动主体。」
对做 AI 的我们来说,这意味着:光会调 prompt 不够了,未来要懂的是“怎么让模型动手”的整套体系。2026 年,这些缩写不再只是论文里的冷冰冰字母——它们正在变成工厂的机械臂、家里的服务机器人、城市的无人配送车。
END
最近拉了个 AI 技术交流群👋,每天互通行业一手资讯、交流踩坑经验,免费拿【2026大模型全套】+【AI全套学习资源】。入口在下面👇
图片/素材来源于网络,其版权归原作者所有,侵删
⭐“点赞、分享、推荐”三连↓

