大数跨境

速递|前字节Seed强化学习专家孙鹏加入星尘智能,将大模型后训练经验带到物理世界

速递|前字节Seed强化学习专家孙鹏加入星尘智能,将大模型后训练经验带到物理世界 AI前线
2026-09-02
24
导读:曾参与《星际争霸》《炉石传说》等游戏的智能体研发
作者 | 四月

9 月 2 日消息,前字节跳动 Seed 团队强化学习专家、腾讯 Robotics X 智能体中心前负责人孙鹏博士正式加入星尘智能,将重点负责机器人强化学习方向的技术研发与应用探索

顶尖技术专家的加盟,印证了星尘智能的行业势能。创始人来杰拥有 17 年 AI 与机器人研发经验,曾是百度小度机器人操刀者及腾讯 Robotics X 实验室"1 号员工”。在技术路径上,星尘智能另辟蹊径,以“绳驱”本体破局,确立了"AI 模型 + 具身 OS+ 绳驱本体”的全栈研发架构

资本与商业化层面,公司今年 6 月完成 B 轮系列融资创下三个月内连融 3 轮、累计超 10 亿元,估值突破百亿元的纪录,投资方包括蚂蚁集团、经纬创投、国科投资等一线机构。其起售价 8.99 万元的 T1 机器人产能已拉升至万台级,并斩获零售、工业等多场景千台级订单。硬件与商业的成熟,为算法演进提供了真实的落地场景。

过去十余年,孙鹏的技术生涯始终围绕强化学习与智能体展开,应用场景从早期的机器人控制,迁移至《星际争霸》《炉石传说》等复杂博弈 AI,再延伸至大规模强化学习基础设施及大模型 RLHF、强化微调与 Agent 领域。

此次回归机器人领域具有深层行业意义。当前,机器人基础模型主要解决“会不会做”的问题,而随着机器人从 Demo 走向真实场景,行业面临更现实的挑战:动作能做出来,不代表能够长期、稳定、高成功率地做好。如何让机器人依据真实执行结果和环境反馈不断修正自身策略,使强化学习重新成为具身智能行业的关键技术方向。

十余年深耕强化学习

孙鹏博士毕业于清华大学,先后在康奈尔大学和罗格斯大学从事博士后研究。早期在腾讯 AI Lab 及 Robotics X 期间,他担任智能体中心负责人,主攻深度强化学习与机器人控制。

在机器人领域,他利用深度强化学习和对抗博弈训练轮式机器人,实现端到端主动目标跟随;在复杂博弈方向,参与研发《星际争霸》AI 智能体 TStarBots、TStarBotX,探索多智能体强化学习在长时序、高复杂度决策环境中的应用。
加入字节跳动后,孙鹏的工作从算法研究扩展至大规模 RL 系统工程
其间,他主导开发强化学习基础设施 ByteRL,支撑多款自研游戏 AI 的规模化训练。其团队曾获 IEEE CoG 2023 策略卡牌 AI 竞赛冠军,并研发《炉石传说》AI,在复杂策略环境中探索强化学习的决策与泛化能力。
随着大语言模型兴起,孙鹏的研究重心转向大模型强化学习和后训练
在字节 AI Lab/ByteResearch 期间,他作为项目负责人参与研究并发布强化微调方法 ReFT(Reinforced Fine-Tuning)及数学推理智能体 DeltaProver;进入 Seed 团队后,进一步参与模型 RLHF、预训练、模型对齐、推理增强及 Agent 相关工作。
从机器人控制、游戏 AI 到大模型后训练,孙鹏过去十余年的工作虽横跨不同技术周期,但核心逻辑高度一致:如何让智能体通过与环境交互获得反馈,并利用反馈持续优化自身行为策略。
随着 AI 进一步进入物理世界,这套经验正重新赋能机器人领域。

强化机器人后训练

孙鹏的加入,将重点推动星尘智能在机器人强化学习及模型后训练方向的建设。

目前,星尘智能正推进由AI 模型、具身 OS 和绳驱机器人本体组成的技术体系。其提出的Design for AI 思路,核心是将机器人本体、数据获取与模型训练进行协同设计,而非割裂发展。

模型侧,星尘智能已推出Lumo 系列具身模型

其中,Lumo-1 主要探索机器人对动作意图及因果关系的理解;Lumo-2 引入 Latent World Dynamics,在隐空间中预测未来环境状态并生成动作。此外,其前端 Agent Philia主要承担长期记忆、任务管理、多机器人协同及自然交互等功能。

相比基础模型负责学习“如何完成任务”,强化学习更多位于训练链条的后端:在机器人完成基础能力学习后,通过真实任务执行获得反馈,进一步优化动作策略、成功率及长期部署适应能力。这一方向与孙鹏此前在大模型 RLHF、强化微调及大规模 RL 系统中的积累高度契合。

下一步,星尘智能计划探索大模型时代广泛应用的强化学习后训练方法,将其与真实机器人的执行反馈、数据回流及长期部署相结合,使模型不仅能在单次任务中成功,更能在真实环境的重复执行中持续优化策略。

孙鹏表示:“过去十多年,我亲历了强化学习从机器人控制、复杂博弈走向大模型后训练的过程。现在,我希望把这些积累真正带回物理世界。”他期待将强化学习深度融入真实机器人的训练与部署,让机器人在持续的真实执行和反馈中不断提升任务表现。

声明:本文为 AI 前线编辑,不代表平台观点,也不构成投资建议,未经许可禁止转载。

【声明】内容源于网络
0
0
AI前线
面向AI爱好者、开发者和科学家,提供大模型最新资讯、AI技术分享干货、一线业界实践案例,助你全面拥抱AIGC。
内容 8691
粉丝 0
AI前线 面向AI爱好者、开发者和科学家,提供大模型最新资讯、AI技术分享干货、一线业界实践案例,助你全面拥抱AIGC。
总阅读198.5k
粉丝0
内容8.7k