作者丨邓哲敏
编辑丨齐铖湧
今天教会机器人拧瓶盖,明天再让它抓杯子,它可能已将前者忘得一干二净。反观人类,新旧知识有序存储,习得新事物的同时不会冲刷掉旧有认知。
这套终身学习机制正是当下大模型所欠缺的。Demis Hassabis、梁文锋与 Ilya Sutskever 均指出,大模型在通过微调注入新知识时,往往会导致“灾难性遗忘”,即丢失过往技能;即便依靠超长上下文临时读取信息,也无法将经验真正固化进模型本体。
灾难性遗忘是推动持续学习成为研究热点的核心痛点,尤其在 LLM-Agent 赛道,业界亟需打造能在部署后不断吸收经验、修正认知且保留原有能力的智能体。对于具身智能而言,若始终“学新忘旧”,其商业化落地将面临比大模型更致命的挑战。
阿尔伯塔大学强化学习团队旨在补上这一基础短板,提出了一套基于快速学习加元学习双系统的持续强化学习框架 FAME。该论文已被 ICRL 2026 收录。AI 科技评论联系了论文共同第一作者张鸿铭、孙科,深入探讨了论文背后的思路及对持续强化学习方向的判断。
论文链接:https://arxiv.org/abs/2603.00903
01 从经验方法走向原则性分析框架
传统强化学习默认环境不变,智能体只需在固定奖励函数和状态转移中寻求最优解。然而现实世界要求智能体兼具两种能力:可塑性(面对新任务快速适应)与稳定性(学习新任务后保留旧知识)。
这两种能力天然存在张力:学习新任务易覆盖旧知导致灾难性遗忘,而旧知有时又阻碍新任务的学习。现有方案如经验回放、参数正则化等多属经验性修复,缺乏统一的算法基础理论指导。
作为强化学习重镇,阿尔伯塔大学 Richard Sutton 教授一直强调,真正的智能应能在持续交互中解决问题且不遗忘。基于此,研究团队首先定义了持续强化学习中的两个核心问题:“任务差异度”与“遗忘程度”。
理论基础一:定义环境距离,刻画任务差异
在强化学习中,任务差异不仅源于奖励函数,也来自状态转移机制。论文利用两个马尔可夫决策过程对应的最优值函数或最优策略之间的距离来定义环境差异。该定义综合了奖励与状态转移的差异,数学表达简洁,为后续算法设计奠定基础。
理论基础二:定义灾难性遗忘,量化遗忘程度
强化学习的数据分布取决于策略,简单比较神经网络参数变化无法准确反映行为遗忘。研究团队分别从值函数或策略函数定义序列决策中的灾难遗忘,并引入状态访问分布加权机制。其核心逻辑是:判断是否遗忘,应重点关注过去任务中真正重要、被访问过的状态和动作,而非对整个状态空间一视同仁。
基于上述定义,持续强化学习的知识整合步骤可显式转化为一个灾难性遗忘最小化的优化问题,为双学习算法框架提供了核心原则。
02 像人脑一样用两个学习系统协同学习
基于理论推导,团队提出FAME(Principled Fast and Meta Knowledge Learners)。该框架受人类海马体与大脑皮层协同机制启发:快速学习模块(Fast Learner)模仿海马体,负责知识迁移以加速新任务上手;元学习模块(Meta Learner)模仿大脑皮层,负责知识整合,将新知并入长期库。
为何需要双系统?孙科从统计学角度解释:单个模型难以同时拟合无穷多个变化的数据分布。FAME 的创新在于将生物启发的概念转化为明确的数学公式,清晰界定各部分的目标与实现路径。
框架的核心机制包含两点:
一是快速学习模块中的自适应热启动。面对新任务,算法通过统计学假设检验(one-vs-all),在“继承元学习策略”、“微调上一任务”和“随机初始化”三者中自动选择最优起跑点。若历史知识适用则加速训练;若任务相似则微调;若完全陌生则随机初始化。
二是元学习模块的知识整合。利用前述“灾难性遗忘最小化”目标,将新知识并入长期库。在离散动作下等价于增量式极大似然目标,连续动作下则对应最小化 KL 散度或 Wasserstein 距离,从而在数学上勾连了持续学习与多任务学习。
实验覆盖 MinAtar、Atari 及 Meta-World 机器人操作场景,横跨离散与连续动作、值函数与策略函数。结果显示,FAME 在平均性能、前向迁移及抗遗忘三项指标上,全面优于 Reset、微调、PackNet 等基线,且随着任务数量增加优势愈发明显。消融实验进一步证实,自适应热启动与知识整合两步缺一不可。
03 持续学习的理论新解与产业落点
持续学习究竟是学术细分话题还是 AI 发展的必经之路?孙科认为,Scaling Law 虽能缓解初级智能的遗忘问题,但若目标是超级智能,持续学习仍是“皇冠上的明珠”。依赖重训的流水线模式终究无法支撑无限规模的进化。
张鸿铭从历史视角指出,从 DQN 到 AlphaGo,再到 RLHF,AI 的每一次突破背后都有强化学习的影子。要实现能力上限的突破,必须依靠算法本身的进化,而非单纯堆砌人力。这也解释了为何自进化(Self-evolution)的内核依然是强化学习:与环境交互、获取反馈、迭代提升。
行业顶尖研究者对此已有共识。Demis Hassabis 强调持续学习与长期记忆是尚未攻克的核心壁垒;梁文锋认为 Agent 发展到一定阶段后,分水岭即是持续学习;Ilya Sutskever 创立的 SSI 更是直接聚焦测试时训练与体验式智能,主张 AGI 应像少年般边实践边学。
在具身智能领域,世界模型与 VLA 本质上仍未脱离强化学习范畴。针对 Sim-to-Real Gap,伯克利 Sergey Levine 团队的 SERL 系统已证明,通过真机强化学习可将成功率推至极高量级。
关于无监督自探索,孙科表示:“无监督永远是正确的,但未必是最高效的。”明确的监督方向对于获取惊艳的下游效果至关重要。
两位作者的经历也是该领域人才流动的缩影。张鸿铭师从 Martin Müller,现任中科院自动化所助理研究员,聚焦强化学习与大模型决策及芯片设计优化等应用。
个人主页:https://initial-h.github.io/index.html
研究聚焦深度强化学习与蒙特卡洛树搜索等决策推理算法,关注其在游戏 AI、大模型和具身智能中的应用。
孙科目前在美国宾夕法尼亚大学做博士后,计划回国进入高校并与产业界合作。他主张高校研究应回归基础科学问题,由下而上影响行业,技术路线上倾向于先在大模型领域深耕,再向具身智能拓展。
个人主页:https://sites.google.com/view/kesun
研究主要聚焦于强化学习,尤其关注算法分析和设计的数学与统计原则。
04 结语
FAME 框架虽仍有边界,如基于 Q 值的遗忘度量对奖励尺度敏感等,但它成功回答了一个本质问题:持续学习能否从经验性修补变为一门有原则的学问。论文给出的答案是肯定的。
正如两位作者所强调,要造就超级智能,靠堆数据和重训行不通,必须让智能体像人一样,一边学、一边用、一边不忘。
未经「AI 科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!
公众号转载请先在「AI 科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

