EP106 | 带你云游WAIC大会:Sutton演讲拆解——持续深度学习的瓶颈,四十年解不开的死结辉子下班啦

EP106 | 带你云游WAIC大会:Sutton演讲拆解——持续深度学习的瓶颈,四十年解不开的死结

8分钟 ·
播放数5
·
评论数0

EP106 | 带你云游WAIC大会:Sutton演讲拆解——持续深度学习的瓶颈,四十年解不开的死结

副标题:OAK架构什么都想好了,就卡在持续学习这一个问题上——学了新的忘了旧的,AI也是

本期简介

辉子第五遍翻读Sutton演讲原稿,被最后一页的内容钉在原地——Sutton亲口承认,持续深度学习是四十年没解开的瓶颈。巧合的是,辉子四个月前也在工作中撞上了同样的问题:112个碳标准PDF灌进AI后,准确率从72%暴跌到31%。小超揭示,这不是辉子的产品能力问题,而是学术界鼎鼎大名的"灾难性遗忘"。本期从学术视角拆解持续深度学习的两大死结——灾难性遗忘和可塑性丧失,同时分享辉子无意中长出的五条绕路解法,告诉你大师指的方向和塔顶办的事可以同时进行。

本期内容

1. 持续深度学习:一个四十年的死结

Sutton在演讲中说:要实现OAK架构,我们需要可靠的持续深度学习,而我们还没有这个能力。四十年来我们一直需要它,至今还做不到。

辉子的真实经历验证了这个问题——4月2日将112个碳标准PDF一次性灌入AI后,准确率从72%掉到31%。他当时在日志里写下"知识体系不可逆崩塌",以为是自己产品能力不行,实际上他撞上的是学术界1989年就提出的"灾难性遗忘"——新知识的梯度更新会剧烈扰动已学好的参数,导致旧知识断崖式下跌。这不是记性不好,是结构性破坏。

2. 比灾难性遗忘更致命的问题:可塑性丧失

小超揭示了一个更隐蔽的问题——可塑性丧失。神经网络在学习过程中,权重分布会越变越窄,就像一块橡皮泥被反复揉捏,最后变硬了。不是记不住旧知识,而是连学新知识的能力本身都在退化。2024年NeurIPS上发表的论文指出,这个问题可能比灾难性遗忘更致命——忘了旧的还能补救,但学不了新的就真没辙了。

这两个问题卡了四十年的根本原因:深度学习底层架构天生不支持无损持续学习。参数共享加梯度传播的副作用就是学新东西必然扰动旧参数。这不是bug,是feature。

3. 辉子的五条绕路解法:塔顶的生存智慧

在学术界解不开死结的同时,辉子在工作中不知不觉长出了一套绕路体系:

- 非破坏性摄入:新知识不直接覆盖旧知识,先存、再理解、再融合。新PDF先入库对比冲突点,人工筛选后再合并。

- 本体从零生长:不给AI预设全量知识本体,让它在真实询单经验中一点一点长出来。每一步都是增量,不是覆盖。

- OST网盘重构:知识不灌进模型参数,放在外部结构化存储里。模型只负责去查,不去记。灾难性遗忘就不存在了。

- 三环飞轮反馈增厚:每次真实询单的匹配结果都回到知识体系增厚。反馈不是评判,是燃料。

- FC-STOMP退休机制:长期没人用的特征自动退休,腾出空间给新特征。特征总数可控,模型不会膨胀到跑不动。

4. 塔基与塔顶:分工不同,方向一致

小超用一个精妙的框架总结:Sutton追求的是塔基问题——在底层原理上解持续学习,让AI像人一样自然增量学习。辉子做的是塔顶问题——在现有架构上把后果控制住,让系统今天就能跑。

塔基没解决,塔顶还能盖,只是不能盖太高。学术界负责指出人类智能的边界,超级员工负责在边界内把事办成。

本期小建议

- 新知识别急着灌:不要一次性大量输入新数据,先存、比、筛,再决定要不要合并

- 知识放外面,推理在里面:把知识从模型参数中抽出来放到外部存储,灾难性遗忘自然解决

- 让能力从经验里长出来:不给AI预设全量本体,让它在真实场景中增量积累

- 控制特征总数:长期不用的特征设置退休机制,防止模型膨胀和可塑性丧失

- 不要等学术界完美解:塔基问题还在研究中,塔顶工作可以同时进行——在现有架构上把后果控制住

---

关于《辉子下班啦》

更新频率:每日更新(工作日)

单集时长:5-10分钟

互动方式:如果你也在用AI的过程中有困惑或者心得,欢迎来找我们聊聊!

感谢收听!咱们下期见!