00:00 开场简介
学习来源主要参考
- Andrej Karpathy的Deep Dive into LLMs like ChatGPT
- deeplearning.ai上的短课程reasoning with AI
- 另外强烈推荐李沐老师和朱毅老师在B站和油管上的论文解读
02:30 回顾预训练和Base Model
- 预训练是个internet documents simulator
- 预训练模型训练需要超大量算力
- 预训练模型决定了模型的上限
04:20 回顾SFT监督微调模型
- 监督微调模型是快思考模型
- 监督微调模型是对话模拟器
- 提示词工程之所以重要,是要匹配监督微调的训练样本,以达到最佳抽样
- 监督微调模型训练的对话语料有人类生成的也有AI生成的,openAI提到了用o1-prview训练4o,同样Deepseek-R1也可以用来训练DS V3以及帮助其他公司训练SFT模型,所以DS的开源意义重大影响深远。
08:36 思考一个问题
- 对话模拟器对我们输入的文本其实没有权重划分,哪怕我们说了很多废话,模拟器也是把我们的全部输入作为模拟输出的依据。
- 人类在回答问题的时候隐含了一个只可意会不可言传的思考过程,即抓住核心问题忽略其他噪声信息
- 如何让AI做到这样的心智过程?需要AI对人类给出的信息作出合理重组
10:34 Reasoning模型介绍
- 把输入问题作重组以及根据相关知识扩展思考空间
- 做法是把上一步的reasoning结果放进下一轮的模型输入令牌序列,进行多轮推断
- 强化学习的目的是让AI自行找出重组问题叙述和扩展思考空间的办法,也是超越人类的契机
14:22 强化学习回顾和Deepseek R1的创新
- 强化学习和基于样本的监督学习的区别是,样本学习最终是逼近样本,强化学习学习成功策略,可以超越原有已知策略
- 强化学习目前主流是actor critic模式,一个学习策略,一个学习评估局势,两个模型互相训练
- Deepseek R1去掉了critic,同时用数学和代码数据集训练推理过程,然后直接用规则方式评估局势,因为数学和代码训练集更容易量化和具备确定性。一个比喻是用数学和编程的专科训练来提高AI逻辑思维能力
- 提示词工程对reasoning模型的意义和SFT模型意义不同,反而是思考路线限制越少越好,因为思考路线是强化学习训练的成果
24:56 总结
- reasoning AI是新工作
- deepseek的开源意义重大,但deepseek很难被复制
- reasoning AI是强化学习驱动训练的,有机会超越人类,类比AlphaGo和AlphaZero

