← 返回资讯热点
AI热点雷峰网发布时间:2026-09-15 02:18热度 228.0000

强化学习大本营新作:如何破解「学新忘旧」困局

阿尔伯塔大学团队提出FAME框架,给持续强化学习一个可求解的公式。 作者丨 邓哲敏 编辑丨齐铖湧 今天教会机器人拧瓶盖,明天再让它抓杯子,它可能又把拧瓶盖忘得一干二净。 反观人类,这类现象极少出现。人脑拥有成熟的记忆分工体系,新旧知识有序存储,习得新事物的同时不会冲刷掉旧有认知。 这套终身学习的机制,其实是当下大模型同样欠缺的。Demis Hassabis、梁文锋与 Ilya Sutskever 都指出过大模型的固有短板:通过微调注入新知识时,往往会丢掉过往已经掌握的技能;即便靠超长上下文临时读取新信息,也无法把经验真正固化进模型本体。 灾难性遗忘一直是微调范式下挥之不去的痛点,也由此推动持续学习成为近年来的研究热点,尤其是在 LLM-Agent 赛道,人们希望打造能在部署后不断吸收经验、修正认知,同时保留原有能力的智能体。 眼下,具身的处境十分微妙。宇树上市后市场反响不算热烈,多少折射出具身智能商业化的现实挑战。可越是如此,持续学习对具身的长期价值越躲不过去:机器人要在真实世界干活,若始终“学新忘旧”,那比大模型更致命。 阿尔伯塔大学强化学习团队 正是想补上这块基础短板,提出一套基于快速学习加元学习双系统的持续强化学习框架,论文已被 ICRL 2026 收录。AI科技评论(雷峰网公众号)联系到论文的两位共同第一作者张鸿铭、孙科,和他们聊了聊论文背后的思路,以及他们对持续强化学习这个方向的判断。 论文链接:https://arxiv.org/abs/2603.00903 01 从经验方法走向原则性分析框架 传统强化学习有个默认前提:环境是不变的。奖励函数固定,状态转移固定,智能体只要在一亩三分地里磨到最优就行。 现实世界却完全相反,一个真正具有持续学习能力的智能体需要同时具备两种能力: 可塑性 ,即面对新任务时,可以快速学习并适应; 稳定性 ,即学习新任务之后,仍然能够保留过去已经掌握的知识。 然而,这两种能力天然存在张力。智能体在学习新任务后往往会覆盖已有知识,形成灾难性遗忘;与此同时,当新旧任务差异较大时,学到的旧知识反而阻碍新任务的学习。 现有持续强化学习工作提出了经验回放、参数正则化、网络扩展、策略蒸馏等不同方案,但这些方法更像是经验性的修复,背后没有一个好的算法基础理论,能够指导各类算法进一步有体系地前进。 加拿大阿尔伯塔大学是强化学习的大本营,强化学习之父、图灵奖得主 Richard Sutton 在此任教。张鸿铭说,Sutton 一直强调:真正的智能,是能在和环境的持续交互里解决问题,同时不遗忘之前会的东西。持续学习这个概念,在团队里被推到了很高的位置。 基于此,研究团队首先提出两个基础概念,希望回答持续强化学习中“任务到底有多不同”和“智能体到底忘了多少”这两个基本问题。 ▎ 理论基础一:定义不同环境之间的距离,刻画任务有多不同。 在强化学习

来源:雷峰网
说明:本站展示中文整理摘要,便于快速阅读;完整内容和版权归原站所有。