作者丨杨诗涵
编辑丨林觉民
过去一年,“GPT 时刻”成为具身智能发布会的高频词汇,多家厂商宣称已迎来属于机器人的转折点。然而,原力灵机创始人范浩强却对此保持冷静。
作为 16 岁即加入旷视科技、将人脸识别精度做到极致的资深专家,范浩强的判断颇具分量。2025 年 3 月,他与唐文斌、周而进等旷视原班人马联合创立原力灵机,并推出真机评测榜单 RoboChallenge,规定需完成 30 个任务方可上榜。结果显示,部分厂商测至第 29 个任务便止步不前,而口中成功率却喊得最高。
与此同时,原力灵机发布的通用具身基础模型 DM0.5 在 RoboDojo 等权威榜单登顶。面对成绩,范浩强依旧克制,他认为具身行业没有真正的对手,唯一的敌人是残酷的物理世界。
以下是对话实录,内容经精简优化。
AI 先抢走了人最想干的事
AI 科技评论:先用空气炸锅做美食的习惯,和你现在做的工作有相像之处吗?
范浩强:本质都是 Engineering(工程)。搭建一个系统让它运行起来是最快乐的,若能通过调整参数使其不断优化,则更为愉悦。这就像经典的 PID 控制算法,仅三个参数却足以让人钻研一生。
AI 科技评论:高中语文老师曾评价你“想得和大家不一样”,这种思维如何影响你的研究?
范浩强:老师曾将作文分为三类:一类文理应“语不惊人死不休”,二类文是循规蹈矩的大模型生成式写作,三类文则是完全跑题。关键在于,一类文与三类文往往难以区分:出格的想法若被理解就是一类文,不被理解就是三类文。
这一逻辑同样适用于科研。普通研究仅是记录实验,而卓越的研究往往源于大胆甚至看似荒唐的点子。例如去年提出的 Real-timeVLA,当时业界普遍认为 VLA 模型耗时数百毫秒,我提出能否压缩至 30 毫秒,被视作“三类文”。最终我们在家用显卡上实现了这一目标,改变了行业对实时计算的认知。
AI 科技评论:人工智能发展至今,是否如预期般替代了人类不愿做的工作?
范浩强:事实恰恰相反。AI 首先攻克的是人类最想做的创造性工作,如吟诗作画;机器人最先掌握的也是跑步等看似困难的任务。而对于叠被子、铲猫砂等人类习以为常的动作,由于涉及不可预测的形状和力度,反而是机器人最难攻克的领域。这波革命似乎先抢走了人类最想干的事,留下了最不想干的琐事。
Deep Learning 还是比特币?
AI 科技评论:回顾在旷视的 13 年,你认为最正确的决策是什么?
范浩强:早年在外交换期间,我接触到两个新兴方向:神经网络(即后来的 Deep Learning)和比特币。当时主流观点认为深度学习是“歪门邪道”,但我坚持认为值得尝试。最终公司选择了深耕深度学习,成就了后来的人脸识别业务。若当年选择比特币,或许财富格局会完全不同,但技术路线的坚持更具长远价值。
AI 科技评论:为何选择在企业而非高校发展?
范浩强:我曾尝试纯理论研究,但发现数学缺乏中间态,非成即败。相比之下,工科能通过系统构建获得持续的小进步。孙剑博士曾言,最重要的不是萃取神经网络,而是萃取一群人。旷视研究院建立的方法论和文化传承,比单一算法模型更为重要,这也是我选择在企业打造系统的原因。
AI 科技评论:如何看待理论计算机科学与实际应用的关系?
范浩强:室友陈立杰投身 OpenAI 钻研数学,他曾说证明 P 对 NP 问题是为了“人类智慧的光辉”。这类成就虽无直接生产价值,却能穿越时空被后世敬仰。但对于我而言,更倾向于解决实际问题,在物理世界中看到系统运转的反馈。
两三千块手搓一台机器人
AI 科技评论:何时决定重新投身机器人领域?
范浩强:早在 2016 年团队便尝试物流机器人,但受限于高昂成本和算法不成熟而搁置。直到 2023 年,随着零部件国产化导致成本大幅下降,以及 ACT、DiffusionPolicy 等模仿学习算法的突破,我意识到时机已成熟。于是在家中花费两三千元组装了一台六自由度小机器人,验证了低成本控制的可行性,随即拉拢周而进等伙伴正式创业。
AI 科技评论:团队磨合过程中有哪些关键节点?
范浩强:周而进曾通过预训练模型在无后训练情况下成功完成“抓狗”任务,那个夜晚让我们看到了通向未来的道路。此外,唐文斌在深夜发来微信称这是“一生难遇的良机”,坚定了我们做通用机器人的决心。这些时刻汇聚了团队的信念,推动公司正式启动。
具身要干的 9,比人脸识别更多
AI 科技评论:具身智能的可靠性标准与人脸识别有何不同?
范浩强:人脸识别曾做到 11 个 9 的精度,但具身智能面临更复杂的挑战。新的“三个 9"包括:物理空间可达、机械臂精准抓取、系统长期稳定不趴窝。若部署百万台机器人全天候运行,对可靠性的要求将在现有基础上再提升数个量级。目前的 Demo 视频与真实落地之间,仍隔着巨大的鸿沟。
AI 科技评论:如何看待当前行业的 Scaling Law 临界点?
范浩强:真正的智能应从改造世界的劳动中获取。目前采集的数据量和涌现的智能程度远未达标,还需经历几个量级的跃迁。尽管部分友商宣称已实现"GPT 时刻”,但我认为这条路依然漫长,切勿过早激动。
不敢交卷的,成功率喊得最高
AI 科技评论:发起 RoboChallenge 榜单的初衷是什么?
范浩强:针对行业内开源项目仅有 README 而无实物的现象,我们建立了包含 30 个任务的真机评测基准。规则严苛:必须完成所有任务方可上榜。结果显示,许多厂商测至第 29 个任务便放弃提交,而这些“不敢交卷”的公司往往对外宣称的成功率最高。
AI 科技评论:如何评价中美在机器人领域的差距?
范浩强:从训练规模和智能涌现来看,中美仍存在差距,但这一窗口期不会太久。目前美国头部公司也未参与我们的榜单测试,导致无法直观区分顶尖与落后水平。相信未来中国团队将在实现和规模化上迎头赶上。
AI 科技评论:如何看待行业内“大炼钢铁”式的备货现象?
范浩强:这更像是“铸造钢铁”。虽然当前应用节奏与备货节奏错位,导致部分机器人闲置,但这可能是为未来技术爆发积蓄力量。一旦关键技术突破,这些库存将被迅速唤醒。
“世界模型不本质,以后都叫宇宙模型”
AI 科技评论:DM0.5 在记忆维度表现优异,这对机器人落地意味着什么?
范浩强:记忆是智能的基础。例如从冰箱取物后关门,机器人需记住内部状态变化。DM0.5 通过在基模中融合长时帧信息,显著提升了此类任务的处理能力。未来算法在记忆维度超越人类是必然趋势。
AI 科技评论:为何认为“世界模型”概念并不本质?
范浩强:具身原生模型本应包含视觉、语言、动作、记忆及预测的一体化能力。刻意区分 VLA 与世界模型增加了沟通成本。未来这些概念终将融合,不妨统称为“宇宙模型”。真正的核心在于模型是否具备生成理解一体化的属性,而非名称之争。
AI 科技评论:仿真与真机路线是否存在竞争?
范浩强:两者存在对偶性,可相互补充。仿真擅长可重复性和资产制备,真机擅长引入噪声和多样性。无论哪条路线率先突破,都将推动行业进步。我们的竞争对手并非其他公司,而是物理世界的限制。
客户的简单,机器人的地狱
AI 科技评论:为何说客户最简单的问题可能比测试集更难?
范浩强:真实场景往往包含意想不到的变量。例如传送带上以两米每秒移动的物体,打破了模型对静止世界的假设。机器人需在伸手瞬间预判物体位置,这对当前算法构成了降维打击。收集这类真实 Case 并攻克它们,才是落地的关键。
AI 科技评论:评判机器人成功的唯一指标是什么?
范浩强:回本周期。当机器人赚取的利润足以覆盖下一台的制造成本时,规模化扩张便自然形成。目前已有海外客户在“省人”场景下实现三年回本,证明了商业闭环的可行性。
AI 科技评论:硅基智能是否会全方位超越碳基生命?
范浩强:生物学超材料极其强大,现有材料学难以企及。硅基文明将与人类截然不同,它们可能无需长寿和自我修复,而是通过快速迭代繁衍。最终形成的机器人体系,其生存逻辑将与人类完全异质。
十年等一回,那就猛猛干
AI 科技评论:面对中美竞争加剧,团队状态如何?
范浩强:机器人涉及军事与生产力核心,必将成为国家战略级赛道,竞争不可避免。但这正是技术爆发的黄金时期,能够亲身参与其中是难得的机遇。既然十年等一回,那就全力以赴。
AI 科技评论:近期有什么新的兴趣或思考?
范浩强:借助 AI 学习代数几何,感受数学之美。AI 能耐心解释复杂定义,让我体会到超越实体的美感。或许未来 AI 的终极使命之一便是解决黎曼猜想,以此展示人类智慧的光辉。
AI 科技评论:对公司未来有何期许?
范浩强:目前处于公司最美好的阶段:有产品、有团队、无商业化重压,可纯粹地以技术愿景驱动发展。希望能吸引更多学子关注那些看似“不靠谱”的前沿方向,共同迎接下一个技术浪潮。
对话尾声,范浩强重申了“一类文”的理念:在机器能批量生产规范内容的时代,人类的价值在于那些“出格”的创新。从高二挑战人脸识别极限,到如今攻克具身智能难题,保持挑战不可能的心气,始终是穿越周期的唯一入场券。
独家畅览全球 AI 顶会精华
内容涵盖:
专家演讲 PPT
大会报告全文
热门论文解读
学术新星访谈
商汤十年老兵,造出一家独角兽:当行业聚焦 VLA 时,他已押注世界模型
从大疆到华为再到求之,韩磊:世界模型定义之争都是话术,核心只看泛化能力
未经「AI 科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!
公众号转载请先在「AI 科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

