首页 / 资讯详情

强化学习大本营新作:如何破解「学新忘旧」困局

雷锋网 2026-09-15 02:18 中文

摘要

阿尔伯塔大学团队提出FAME框架,给持续强化学习一个可求解的公式。 作者丨邓哲敏 编辑丨齐铖湧 今天教会机器人拧瓶盖,明天再让它抓杯子,它可能又把拧瓶盖忘得一干二净。反观人类,这类现象极少出现。人脑拥有成熟的记忆分工体系,新旧知识有序存储,习得新事物的同时不会冲刷掉旧有认知。这套终身学习的机制,其实是当下大模型同样欠缺的。Demis Hassabis、梁文锋与 Ilya Sutskever 都指出过大模型的固有短板:通过微调注入新知识时,往往会丢掉过往已经掌握的技能;即便靠超长上下文临时读取新信息,也无法把经验真正固化进模型本体。灾难性遗忘一直是微调范式下挥之不去的痛点,也由此推动持续学习成为近年来的研究热点,尤其是在 LLM-Agent 赛道,人们希望打造能在部署后不断吸收经验、修正认知,同时保留原有能力的智能体。眼下,具身的处境十分微妙。宇树上市后市场反响不算热烈,多少折射出具身智能商业化的现实挑战。可越是如此,持续学习对具身的长期价值越躲不过去:机器人要在真实世界干活,若始终“学新忘旧”,那比大模型更致命。阿尔伯塔大学强化学习团队正是想补上这块基础短板,提出一套基于快速学习加元学习双系统的持续强化学习框架,论文已被 ICRL 2026 收录。AI科技评论(雷峰网公众号)联系到论文的两位共同第一作者张鸿铭、孙科,和他们聊了聊论文背后的思路,以及他们对持续强化学习这个方向的判断。论文链接:https://arxiv.org/abs/2603.0090301从经验方法走向原则性分析框架传统强化学习有个默认前提:环境是不变的。奖励函数固定,状态转移固定,智能体只要在一亩三分地里磨到最优就行。现实世界却完全相反,一个真正具有持续学习能力的智能体需要同时具备两种能力:可塑性,即面对新任务时,可以快速学习并适应;稳定性,即学习新任务之后,仍然能够保留过去已经掌握的知识。然而,这两种能力天然存在张力。智能体在学习新任务后往往会覆盖已有知识,形成灾难性遗忘;与此同时,当新旧任务差异较大时,学到的旧知识反而阻碍新任务的学习。现有持续强化学习工作提出了经验回放、参数正则化、网络扩展、策略蒸馏等不同方案,但这些方法更像是经验性的修复,背后没有一个好的算法基础理论,能够指导各类算法进一步有体系地前进。加拿大阿尔伯塔大学是强化学习的大本营,强化学习之父、图灵奖得主 Richard Sutton 在此任教。张鸿铭说,Sutton 一直强调:真正的智能,是能在和环境的持续交互里解决问题,同时不遗忘之前会的东西。持续学习这个概念,在团队里被推到了很高的位置。基于此,研究团队首先提出两个基础概念,希望回答持续强化学习中“任务到底有多不同”和“智能体到底忘了多少”这两个基本问题。▎理论基础一:定义不同环境之间的距离,刻画任务有多不同。在强化学习中,一个任务可以表示为一个马尔可夫决策过程,两个环境之间的差异不仅可能来自奖励函数,也可能来自状态转移机制。论文利用两个马尔可夫决策对应的最优值函数或者最优策略之间的距离,定义两个环境的差异,这种定义同时吸收了奖励函数和状态转移机制差异,在数学定义上更加简洁,为后续算法优化和设计奠定基础。▎理论基础二:定义灾难性遗忘,刻画智能体在不同任务间遗忘了多少。与监督学习不同,强化学习中的数据分布本身取决于策略。因此,简单比较两个神经

阅读原文(雷锋网)→

本站为资讯聚合平台,仅展示标题与摘要,原文版权归原发布方所有;如有侵权请联系我们删除。