大数跨境

“我没疯,是整个AI圈疯了!”强化学习之父:没有任何动物靠监督学习长大,大模型上线后根本没在学习

“我没疯,是整个AI圈疯了!”强化学习之父:没有任何动物靠监督学习长大,大模型上线后根本没在学习 AI科技大本营
2026-08-20
3
导读:要迈向新范式,大厂根本承受不起性能倒退的阵痛。

要迈向新范式,大厂根本承受不起性能倒退的阵痛。

编译 | 王启隆
出品丨奇点折射(ID:rgznai100)

强化学习奠基人、《苦涩的教训》(The Bitter Lesson)作者理查德·萨顿(Rich Sutton),近期携学生胡拉姆·贾韦德(Khurram Javed)做客红杉资本播客。两人联合创办的新机构 Oak Lab,旨在从底层推翻当前大模型的主流范式

当前 AI 界热衷于扩大模型规模及利用“合成数据”填补互联网数据枯竭的缺口。对此,萨顿直言合成数据是巨大的错误,现实世界的复杂性远超任何模拟器;而当下流行的大语言模型部署后权重即固化,“根本没在学习”,仅能代表智能的四分之一。

面对质疑,这位曾历经 AI 寒冬与癌症晚期的学者态度坚决:“我没疯,是这个领域疯了。”

萨顿与贾韦德在对话中剖析了前沿实验室被困于“局部最优解”的困境,并提出终极解法:抛弃静态训练,攻克灾难性遗忘,致力于在五至十年内构建出功耗仅 20 瓦、能像生物一样边行动边进化的持续心智系统。

核心观点

  • 监督学习的本质:

    没有任何动物是通过监督学习获得生存智能的。学校是人类特有的特殊机制,并非智能的本质。将监督学习视为主流范式是本末倒置。

  • 大模型是否在学习:

    模型上线后权重不再变化,意味着学习停止。打造拥有博士级能力却不再学习的系统是荒谬的。

  • 合成数据与真实世界:

    合成数据无法模拟无限复杂的现实世界(如电机磨损、人类思维)。必须剔除人类干预,让 Agent 直接在现实经验中摸索。

  • 大实验室为何无法转向:

    大厂被成熟产品的商业闭环锁定,无法承受迈向新范式初期性能下降的阵痛,因而被困在局部最优解中。

  • 语言模型的终局:

    大语言模型是令人惊叹的突破,但仅是 AI 的局部子问题。语言或许只占智能的四分之一,探索远未结束。

我没疯,是这个领域疯了:所有的学习本来就该是持续的

主持人回顾了萨顿在强化学习领域的奠基性贡献及其著作《苦涩的教训》。萨顿表示,自己投身该领域源于对心智本质的探索:学习与目标是智能的核心。谈及早年遭遇癌症晚期仍坚持研究的经历,萨顿坦言这更多是习惯使然。

萨顿强调,在当前的 AI 狂潮之前,“持续学习”本是不言自明的常识。所有学习本质上都是持续的,系统应在行动中不断感知与进化。学界特意发明“持续学习”这一术语反而显得奇怪,真正偏离常识的是当前认为学习可以停止的观点。

关于《苦涩的教训》,萨顿将其精髓概括为:不要试图注入人类知识,而应专注于那些能随算力扩张而扩展的方法(如搜索与学习)。他认为大语言模型既是该教训的正面典型(实现了算力扩展),也是反面典型(过度依赖有限的人类互联网数据,最终将受限于此)。

合成数据是个巨大错误,真实世界永远比模型大得多

针对业界试图通过“合成数据”突破数据瓶颈的做法,萨顿与其学生贾韦德予以坚决否定。他们提出了“大世界假说”(Big World Hypothesis):现实世界无限庞大且复杂,任何单一模型或合成数据都无法对其进行完美近似。

贾韦德指出,合成数据的生成依赖人类专家的定义与筛选,这直接受限于人类的认知瓶颈。例如,无人机在物理世界中的摩擦磨损、人类大脑的思维活动,都无法通过代码生成保真的合成数据。世界包含无数其他 Agent,其复杂度远超单一系统的容量

萨顿认为,真正的智能系统必须直接从经验中学习,将人类从循环中剔除。虽然模拟器在特定场景(如自动驾驶)中有用,但修复“虚实差距”的过程仍需大量人力介入。理想的路径是让 Agent 自主构建世界模型,并在遇到未知情况时通过持续学习自行修正,而非依赖人类预先搭建的完美环境。

上线后权重根本不变,那不叫学习

对话深入探讨了先验知识与习得知识的关系。萨顿澄清,《苦涩的教训》并非排斥先验知识,而是反对因依赖先验知识而抑制学习机制。两者本应相辅相成:先验知识是已掌握的内容,随后通过学习获取新知,新知又转化为新的先验。

然而,当前大语言模型在预训练和后训练结束后,上线运行时权重完全固化,不再发生任何改变。萨顿批评道,如果一个系统拥有博士级能力却从此停止学习,那才是真正奇怪的。真正的智能助手应在使用过程中随着对用户了解的加深而不断进化。

针对个性化定制,贾韦德指出,目前依靠上下文窗口(Context Window)实现个性化效率低下且无法沉淀。他类比人类神经可塑性:即使丧失本体感觉,人类也能通过视觉反馈重新学会走路。AI 系统也应具备这种权重层面的动态调整能力,而非仅仅依赖静态记忆。

萨顿进一步反驳了“监督学习”作为智能范式的合理性。自然界中没有任何动物通过接收肌肉运动的标签指令来学习行走或捕猎。学校式的监督学习是人类社会的特殊产物,绝非智能的本质。智能的核心在于通过试错和反馈,自主摸索出适应环境的策略。

破除灾难性遗忘:让模型在学习新知识的同时学会“如何学习”

关于如何让机器具备想象力和范式转移能力,贾韦德认为关键在于系统能否基于自身经验提炼出新的抽象概念,并利用这些抽象进行规划。当前系统缺失的正是这种自主学习世界模型并据此规划的能力。

萨顿介绍了其提出的“阿尔伯塔计划”,核心在于实现持续深度学习正确的抽象提炼。目前的挑战主要在于算法层面,特别是如何解决灾难性遗忘(Catastrophic forgetting):即在用新样本更新模型时,不破坏原有的旧知识。

解决方案包括: 1. 步长优化:对每个权重进行元学习,设定独立的更新步长,确保大部分旧知识稳定,仅在必要位置更新。 2. 生成并测试机制:引入类似“持续反向传播”的算法,不断播撒新单元种子并随机初始化,通过反向传播检验其有效性,从而在不依赖梯度的情况下主动探索新特征。

萨顿强调,这些算法需要从零开始训练,让模型在学习具体知识的同时,同步学会“如何在未来学习新知识”。

大实验室被困在局部最优解里

谈及为何主流大厂未采用上述激进方案,萨顿与贾韦德一致认为,这是因为巨头们被困在了局部最优解中。现有的 Scaling 范式仍能带来商业回报,而转向新范式必然经历初期性能下降的阵痛期,这是追求短期 SOTA(业内最佳表现)的大厂无法承受的。

Oak Lab 的愿景是构建一个涵盖从微观感知到宏观推理的全光谱知识体系,打造一个能自我维持、保持认知连贯的心智系统。贾韦德预测,随着摩尔定律的演进和算法效率的提升,未来五到十年内,实现万亿参数模型在 20 瓦低功耗下运行是完全可能的。

对于大语言模型的未来,萨顿重申:LLM 是科学上的伟大突破,证明了神经网络处理语言的强大能力,但它只是 AI 的一个局部子问题(约占智能的四分之一)。真正的通用智能远不止语言流畅,还包括感知、行动与持续进化。未来的世界将涌现出多个各自分立、在不同经验中不断进化的智能系统,而非单一的万能模型。

【声明】内容源于网络
0
0
AI科技大本营
为AI领域从业者提供人工智能领域热点报道和海量重磅访谈;面向技术人员,提供AI技术领域前沿研究进展和技术成长路线;面向垂直企业,实现行业应用与技术创新的对接。全方位触及人工智能时代,连接AI技术的创造者和使用者。
内容 7110
粉丝 0
AI科技大本营 为AI领域从业者提供人工智能领域热点报道和海量重磅访谈;面向技术人员,提供AI技术领域前沿研究进展和技术成长路线;面向垂直企业,实现行业应用与技术创新的对接。全方位触及人工智能时代,连接AI技术的创造者和使用者。
总阅读148.5k
粉丝0
内容7.1k