9 月 2 日消息,前字节跳动 Seed 团队强化学习专家、腾讯 Robotics X 智能体中心前负责人孙鹏博士正式加入星尘智能,将重点负责机器人强化学习方向的技术研发与应用探索。
顶尖技术专家的加盟,印证了星尘智能的行业势能。创始人来杰拥有 17 年 AI 与机器人研发经验,曾是百度小度机器人操刀者及腾讯 Robotics X 实验室"1 号员工”。在技术路径上,星尘智能另辟蹊径,以“绳驱”本体破局,确立了"AI 模型 + 具身 OS+ 绳驱本体”的全栈研发架构。
资本与商业化层面,公司今年 6 月完成 B 轮系列融资,创下三个月内连融 3 轮、累计超 10 亿元,估值突破百亿元的纪录,投资方包括蚂蚁集团、经纬创投、国科投资等一线机构。其起售价 8.99 万元的 T1 机器人产能已拉升至万台级,并斩获零售、工业等多场景千台级订单。硬件与商业的成熟,为算法演进提供了真实的落地场景。
过去十余年,孙鹏的技术生涯始终围绕强化学习与智能体展开,应用场景从早期的机器人控制,迁移至《星际争霸》《炉石传说》等复杂博弈 AI,再延伸至大规模强化学习基础设施及大模型 RLHF、强化微调与 Agent 领域。
此次回归机器人领域具有深层行业意义。当前,机器人基础模型主要解决“会不会做”的问题,而随着机器人从 Demo 走向真实场景,行业面临更现实的挑战:动作能做出来,不代表能够长期、稳定、高成功率地做好。如何让机器人依据真实执行结果和环境反馈不断修正自身策略,使强化学习重新成为具身智能行业的关键技术方向。
十余年深耕强化学习
孙鹏博士毕业于清华大学,先后在康奈尔大学和罗格斯大学从事博士后研究。早期在腾讯 AI Lab 及 Robotics X 期间,他担任智能体中心负责人,主攻深度强化学习与机器人控制。
强化机器人后训练
孙鹏的加入,将重点推动星尘智能在机器人强化学习及模型后训练方向的建设。
目前,星尘智能正推进由AI 模型、具身 OS 和绳驱机器人本体组成的技术体系。其提出的Design for AI 思路,核心是将机器人本体、数据获取与模型训练进行协同设计,而非割裂发展。
模型侧,星尘智能已推出Lumo 系列具身模型。
其中,Lumo-1 主要探索机器人对动作意图及因果关系的理解;Lumo-2 引入 Latent World Dynamics,在隐空间中预测未来环境状态并生成动作。此外,其前端 Agent Philia主要承担长期记忆、任务管理、多机器人协同及自然交互等功能。
相比基础模型负责学习“如何完成任务”,强化学习更多位于训练链条的后端:在机器人完成基础能力学习后,通过真实任务执行获得反馈,进一步优化动作策略、成功率及长期部署适应能力。这一方向与孙鹏此前在大模型 RLHF、强化微调及大规模 RL 系统中的积累高度契合。
下一步,星尘智能计划探索大模型时代广泛应用的强化学习后训练方法,将其与真实机器人的执行反馈、数据回流及长期部署相结合,使模型不仅能在单次任务中成功,更能在真实环境的重复执行中持续优化策略。
孙鹏表示:“过去十多年,我亲历了强化学习从机器人控制、复杂博弈走向大模型后训练的过程。现在,我希望把这些积累真正带回物理世界。”他期待将强化学习深度融入真实机器人的训练与部署,让机器人在持续的真实执行和反馈中不断提升任务表现。
声明:本文为 AI 前线编辑,不代表平台观点,也不构成投资建议,未经许可禁止转载。



