Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。
如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。
联系小助手微信:seventy3_podcast(加群/投稿论文)
今天的这篇的主题是:
Language Models Need Sleep: Learning to Self-Modify and Consolidate Memories
Summary
过去几十年见证了机器学习算法设计领域的重大进步,从早期针对特定任务的浅层模型研究,到如今更加通用的深度大语言模型(Large Language Models, LLMs)。尽管现有模型在需要即时预测或上下文学习(in-context learning)的任务中展现出了良好的效果,但它们仍然缺乏持续学习的能力,也无法有效地将其随时间积累的上下文知识迁移到长期参数中。
受到人类学习过程的启发,我们引入了一种称为 “睡眠(Sleep)”范式 的方法,使模型能够持续学习,通过回放(replay)机制将短期且脆弱的记忆蒸馏为稳定的长期知识,并通过“做梦(Dreaming)”过程递归地实现自我改进。
更具体地说,睡眠过程包含两个阶段:
(1)记忆巩固(Memory Consolidation):
这是一个向上的蒸馏过程,称为知识播种(Knowledge Seeding)。在该过程中,将较小版本自身模型(smaller-self)的记忆蒸馏到一个更大的网络中,从而在保留已有知识的同时提供更大的容量。作为概念验证,我们提出了一种新的用于知识播种的广义蒸馏过程(Generalized Distillation process),即结合了**在策略蒸馏(on-policy distillation)**与基于强化学习(Reinforcement Learning, RL)的模仿学习(imitation learning)的蒸馏方法。
(2)做梦(Dreaming):
这是一个自我改进阶段。在该阶段,模型利用强化学习生成一个合成数据课程(curriculum of synthetic data),用于反复练习新知识,并在无需人工监督的情况下优化已有能力。
我们在长时间跨度任务(long-horizon tasks)、持续学习任务(continual learning)、知识融入任务(knowledge incorporation)以及少样本泛化任务(few-shot generalization tasks)上的实验结果,验证了睡眠阶段的重要性。
原文链接:arxiv.org

