5 个关键问题 Q&A
Q1:实体 AI 五层堆栈分别承担什么职能?
A:大脑负责感知理解与任务决策;躯体是机器人本体实现运动;零部件提供底层执行硬件;燃料代表能源、仿真与训练数据;试验场完成真实场景商业化验证。
Q2:VLA 视觉语言动作模型工作逻辑是什么?
A:接收摄像头视觉画面、语音、文字指令,模型综合理解环境与任务目标,输出各关节电机控制指令,驱动机器人完成对应动作。
Q3:工业机器人与人形机器人核心差异?
A:工业机器人专为工厂设计,精度高、重复性强;人形机器人追求通用性、自适应能力,可直接在人类生活工作环境作业,通用潜力更大,但成熟度更低。
Q4:当前人形机器人行业处于哪个阶段?
A:资本热度极高,多家企业推出样机与工厂试点项目,但整体未实现大规模量产商用,专用工业自动化设备仍是当前商业化主力。
Q5:制约人形机器人大规模普及的核心瓶颈?
A:通用智能算法不完善、仿真与现实存在鸿沟;高端零部件成本高昂;缺少海量真实场景训练数据;投入产出比暂时难以满足商业需求。
附录实体 AI 堆栈入门指南
作者:穆什坎・卡尔拉
开篇总览
实体 AI 行业正迎来史上最强融资热潮。2026 年第一季度,机器人与实体 AI 领域初创企业完成 492 笔融资,总融资金额达 163 亿美元,创下行业单季度历史新高。截至 2026 年 5 月末,该赛道全年融资总额已突破 230 亿美元。
行业热词层出不穷:Figure、宇树、GR00T、Skild、谐波减速器、视觉语言动作模型、远程示教…… 一堆专业名词让人眼花缭乱。
在拆解技术堆栈前,先要厘清一个关键认知:实体 AI 的范畴远不止人形机器人。它涵盖工业机械臂、仓储机器人、自动驾驶车辆、农业设备、无人机、手术机器人、四足机器人,以及所有能够感知物理世界并完成实体动作的智能系统。
这个行业并非从零起步:2024 年全球工厂新增约 54.2 万台工业机器人,存量运行设备总量约 470 万台。绝大多数设备并不具备人形,但已经规模化落地、承担实际生产作业。
人形机器人只是这个庞大产业的其中一个分支。它之所以收获最多关注度,是因为一台人形机器人几乎集成了实体 AI 所有核心技术难题:感知、逻辑推理、平衡控制、移动行走、物体操作、触觉交互、动力供给、安全防护、量产制造、现实场景自主学习。
人形机器人不等于整个实体 AI 市场。它是检验实体 AI 全栈技术的终极压力测试载体。
本文将人形机器人作为核心案例展开讲解。只要搞懂人形机器人的完整技术堆栈,仓储机器人、自动驾驶汽车、无人机、工业机械臂的底层逻辑都能套用这套框架理解。
很多新手不知道:一台人形机器人,背后是五大独立产业层层叠加而成。多数企业起步时只在其中某一层具备核心优势,头部玩家则逐步布局多层业务。理清这五层架构,整个行业的脉络会瞬间清晰,任何企业、融资事件、新品发布都能精准对应到框架里。
本文就是这份完整行业图谱,零基础也能看懂。我们将按照机器人的 “大脑→躯体→传动零部件→训练数据→落地应用场景” 逐层拆解讲解。
第一层:大脑 —— 负责决策的人工智能
核心作用
这是一套软件系统,能把 “拿起杯子” 这类人类指令转化为机器人实体动作。它无关金属硬件,是机器人的智能核心。业内常说的 “机器人版 ChatGPT 时代到来”,指代的就是这一层技术。
工作原理
核心关键词:VLA 视觉 - 语言 - 动作模型。简单来说,该模型接收机器人视觉画面、人类文字指令,输出机器人应当执行的动作。它和大语言模型逻辑相似,但大模型预测下一个文字,VLA 模型预测机器人运动轨迹。
模型并非直接控制每一个电机:多数实际系统中,高层模型理解任务目标、规划整体动作;底层控制器负责维持机身平衡、规避碰撞、力度控制、关节高精度运动。
全行业攻坚的核心前沿问题:能否打造通用 “大脑”,适配不同任务、不同机型,而非为单一机器人定制专属模型。
重点关注企业
行业分化出两条技术路线:一类企业自研大脑 + 整机;另一类专注智能算法层,适配第三方硬件设备。
-
Figure:自研 Helix 大模型,配套自家所有人形机器人,软硬件一体化布局 -
Skild AI:融资 140 亿美元,估值超 1400 亿,打造 “全机型通用机器人大脑”,适配各类机器人形态 -
Physical Intelligence:研发 π 系列通用机器人策略模型,纯算法赛道头部企业 -
英伟达 GR00T:开源研发平台,集成基础大模型、数据流水线、仿真环境、训练与部署全链路 -
谷歌 DeepMind:研发 Gemini 机器人大模型,与 Apptronik 合作落地 Apollo 人形机器人 -
Genesis AI:1.05 亿美金种子轮融资,搭建覆盖模型、数据、仿真、硬件的全栈机器人平台
第二层:躯体 —— 人形机器人整机厂商
核心作用
大众直观认知里的机器人本体:双臂、双腿、躯干、头部整套设备。该赛道企业属于整机原厂(OEM),负责整机设计、组装生产。
行业现状
各大品牌频繁发布演示视频、登上媒体头条、斩获高额估值。但有一组关键数据需要留意:市场研究机构 Omdia 测算,2025 年全球人形机器人出货量约 1.3 万台。行业增速迅猛,但基数极低。绝大多数设备目前仅用于科研、教学、产品演示、试点项目,尚未进入大规模量产商用阶段。
重点关注企业
按地域划分赛道玩家:
美国企业
-
Figure:估值 3900 亿美元,与宝马达成合作,美国赛道最受关注企业 -
特斯拉:自研 Optimus 人形机器人,优先落地自有工厂,目前仍处于内部测试早期阶段 -
Apptronik:A 轮融资超 9.35 亿美元,推出 Apollo 人形机器人,与奔驰、GXO 物流、捷普开展试点落地 -
Agility Robotics:旗下 Digit 机器人在 GXO 物流落地,累计搬运超 10 万个货箱;公司宣布 25 亿美元 SPAC 上市计划 -
1X:NEO 家用机器人,早期购机定价 2 万美元,配套远程专家协助完成各类居家任务
中国企业
-
宇树(Unitree):成本优势显著,G1 人形机器人税前不含运费起售价约 1.35 万美元,上海 IPO 已获监管批准 -
智元机器人(AgiBot):Omdia 统计 2025 年全球人形机器人出货量第一,全年出货 5168 台 -
优必选(UBTech):Walker 系列机器人在汽车、电子制造等工业场景测试部署
欧洲及其他地区
-
NEURA Robotics(德国):4NE1 人形机器人,配套完整认知机器人平台 -
波士顿动力(现代集团旗下):Atlas 机器人从科研样机转型工业产品,2026 年将在现代、谷歌 DeepMind 场地落地部署
第三层:零部件 —— 驱动器、齿轮、灵巧手、传感器
核心作用
这是很少出现在宣传物料、但所有机器人都离不开的底层赛道。机械臂运动需要电机、减速器转换扭矩、传感器检测力度与位置、夹持手完成物体交互。一台人形机器人拥有 40 个以上可驱动关节,每一处关节都是独立的工程难题。
核心专业术语
-
驱动器(Actuator):机器人的 “肌肉”,集成电机、减速器、传感器、轴承、控制电路板一体化关节模组。 -
谐波减速器(应变波齿轮):机器人关节内置高精度紧凑型减速器,制造成本高、工艺门槛极高,是人形机器人供应链最核心瓶颈之一。除此之外,电机、滚柱丝杠、轴承、触觉传感器、热管理、设备长期可靠性,全都是行业痛点。
细分赛道龙头企业
-
精密减速器:日本哈默纳科、纳博特斯克;中国绿的谐波 -
驱动器 / 关节模组:三花、拓普、汇川技术(中国人形机器人供应链核心厂商) -
灵巧机械手:Sharpa(22 自由度 Wave 机械手搭载于英伟达 GR00T 参考人形机器人)、Wonik Robotics、兆威、梧智 -
视觉与激光雷达:奥比中光、速腾聚创、禾赛科技、舜宇光学 -
力觉 / 触觉传感器:诺万达旗下 ATI 工业自动化、威士精密 -
机载边缘计算:英伟达 Jetson Thor 系列;高通等其他边缘计算厂商 -
动力电池:宁德时代、三星 SDI、LG 新能源、松下
第四层:燃料 —— 训练机器人的数据
核心作用
再强大的算法大脑,没有训练数据也无法工作。机器人不能像大语言模型一样直接读取互联网海量文本,不存在公开海量高质量数据集,记录机器人视觉画面与对应电机动作。因此本赛道核心是生产训练数据:通过各类方式教会机器人执行任务。该赛道从过去的配套环节,演变为当下融资热度最高的细分领域之一。
四大数据采集方案
远程示教人类通过动作捕捉设备、头戴设备、控制器、主操控臂远程操控机器人完成作业;机器人同步记录视觉画面、各关节运动轨迹、受力数据。优势:真机采集,数据质量高;劣势:成本高昂,难以规模化。
仿真模拟机器人在物理仿真引擎中完成上万次虚拟训练。优势:速度快、成本低、可大规模并行训练;劣势:虚拟环境与真实世界存在差距,“仿真到现实” 的鸿沟是行业核心难题。
人类视频 + 穿戴传感设备依托第一视角拍摄视频、手机影像、人体动作捕捉、作业人员穿戴传感手套采集数据。优势:数据来源充足;劣势:人类肢体运动逻辑和机器人机械结构不匹配,很难转化为精准机器人动作指令。
机群回流数据已落地运行的机器人持续记录作业成功案例、故障场景、极端工况、人工干预操作。长期来看,这会是价值最高的数据来源,数据全部来自客户现场真实作业设备。
重点关注企业
-
XDOF:7000 万美金融资,搭建机器人远程示教数据采集、标注全流程工具链,服务机器人与前沿 AI 实验室 -
Mecka AI:6000 万美金融资,依托人体传感器、手机采集人类动作数据 -
Genesis AI:整合机器人模型、仿真平台、数据基建、穿戴式采集硬件一体化方案 -
Physical Intelligence:融合视觉语言预训练与机器人动作数据,同步研究人类第一视角视频知识迁移 -
英伟达 Isaac/Omniverse:行业主流仿真、合成数据、机器人训练平台 -
整机厂商(Figure、1X、特斯拉、Agility 等):全部自建内部数据团队,机群回流数据将成为企业核心壁垒
第五层:试验场 —— 商业化落地场景
核心作用
前四层全部是技术潜力,本层代表商业化现实:机器人为客户创造实际价值、稳定投产。
行业现状
新手最容易误解的一点:当前真正实现规模化、稳定盈利的机器人,大多并非人形机器人,而是针对特定场景、专属流程定制的专用自动化设备。
人形机器人虽走出纯演示阶段,但绝大多数项目仍处于试点、小规模试用、有限量产区间。
落地代表企业
已实现大规模商用(以非人形设备为主)
人形机器人落地(已有商用,但规模尚小)
-
Figure × 宝马:累计运行时长超 1250 小时,参与 3 万台整车生产流程,但尚未搭建多厂区大规模人形机器人集群 -
Apptronik × 奔驰、GXO 物流、捷普:达成商业合作,开展多条产线试点 -
Agility Robotics × GXO、丰田、舍弗勒、美客多:人形机器人商业化落地最成熟案例之一 -
优必选:国内多条工业产线落地,同步开展海外制造业试点
新手常见认知误区
“人形机器人已经进厂干活” 这句话不完全错误,但表述片面。确实有少量人形机器人在实体工厂执行真实作业,部分企业达成商业合作;但试点项目≠规模化部署集群。
当下真正稳定盈利、大规模普及的自动化设备,依旧是仓储轮式机器人、工业机械臂这类专用机型。人形机器人市场热度与专用自动化落地规模之间的差距,是看懂当前行业格局的关键。
全栈框架总结
今后看到任何机器人行业资讯,都可以对应到五层堆栈中:
-
大脑(决策 AI):Figure Helix、Skild、英伟达 GR00T、Physical Intelligence -
躯体(人形整机厂):Figure、特斯拉、宇树、Apptronik、Agility、1X -
零部件(驱动器、减速器、机械手、传感器):哈默纳科、绿的谐波、Sharpa -
燃料(训练数据):远程示教、仿真模拟、人类视频、穿戴传感、机群回流数据 -
试验场(商业化落地):亚马逊、Symbotic,以及逐步扩张的人形机器人试点项目
当前五层赛道同步涌入巨额资本,看起来行业纷繁复杂;但底层逻辑清晰,是一套完整分层技术堆栈。大脑输出决策,躯体承载整机,零部件实现运动,数据完成训练,落地场景验证设备的可靠性与经济价值。这就是实体 AI 完整产业图谱,其余内容都只是细分细节。
图 1:实体 AI 五层堆栈总览
标题:实体 AI 堆栈入门指南副标题:五层架构、核心概念,打造智能机器人必学知识五大分层:
-
大脑:模型与决策系统 -
躯体:整机搭载、运动控制 -
零部件:驱动器、传感器、硬件 -
燃料:动力电源、能源系统 -
试验场:数据、仿真、真实部署
行业通用核心术语:世界模型、具身智能、远程示教、仿真到现实、基础机器人模型、灵巧操作、多模态
人形机器人赛道格局:Figure、Unitree、特斯拉、优必选、Agility、Apptronik 等多款机型
图 2:机器人投融资创历史新高
标题:机器人风投季度交易规模图例:绿色柱状 = 交易总金额(单位:十亿美元);橙色折线 = 融资笔数数据源:Pitchbook(统计截至 2026 年 3 月 31 日)横轴时间:2021 年一季度 —2026 年一季度左侧标注:每季度机器人初创企业总投资金额右侧标注:每季度完成的风投交易笔数
图 3:VLA 视觉 - 语言 - 动作模型工作原理
标题:VLA 模型运行逻辑输入模块:
-
摄像头(视觉):机器人所见画面 -
麦克风(音频):机器人听到的声音 -
文字指令(语言):人类下达的任务(示例:拿起杯子)
核心模块:VLA 模型(视觉 + 语言 + 动作)说明:模型理解所见画面、接收声音、解析人类指令,输出机器人执行动作
输出模块:电机控制指令(机器人执行动作)示例参数:肩部 45°、肘部 30°、手腕 - 10°、夹爪闭合底部释义:VLA = 视觉(机器人所见)+ 语言(人类指令)+ 动作(机器人执行)
图 4:人形机器人整机厂商图谱
标题:人形机器人整机厂商副标题:2026 年 6 月主流人形机器人企业可视化图谱企业清单:
-
Figure(美国) -
特斯拉(美国) -
NEURA Robotics(德国) -
宇树 Unitree(中国) -
智元 AgiBot(中国) -
优必选 UBTECH(中国) -
Apptronik(美国) -
Galbot(中国) -
Agility Robotics(美国) -
1X(美国 / 挪威) -
Sunday(美国) -
波士顿动力(美国,现代集团旗下)

