
Reasoning AI学习心得分享00:00 开场简介 学习来源主要参考 * Andrej Karpathy的Deep Dive into LLMs like ChatGPT * deeplearning.ai上的短课程reasoning with AI * 另外强烈推荐李沐老师和朱毅老师在B站和油管上的论文解读 02:30 回顾预训练和Base Model * 预训练是个internet documents simulator * 预训练模型训练需要超大量算力 * 预训练模型决定了模型的上限 04:20 回顾SFT监督微调模型 * 监督微调模型是快思考模型 * 监督微调模型是对话模拟器 * 提示词工程之所以重要,是要匹配监督微调的训练样本,以达到最佳抽样 * 监督微调模型训练的对话语料有人类生成的也有AI生成的,openAI提到了用o1-prview训练4o,同样Deepseek-R1也可以用来训练DS V3以及帮助其他公司训练SFT模型,所以DS的开源意义重大影响深远。 08:36 思考一个问题 * 对话模拟器对我们输入的文本其实没有权重划分,哪怕我们说了很多废话,模拟器也是把我们的全部输入作为模拟输出的依据。 * 人类在回答问题的时候隐含了一个只可意会不可言传的思考过程,即抓住核心问题忽略其他噪声信息 * 如何让AI做到这样的心智过程?需要AI对人类给出的信息作出合理重组 10:34 Reasoning模型介绍 * 把输入问题作重组以及根据相关知识扩展思考空间 * 做法是把上一步的reasoning结果放进下一轮的模型输入令牌序列,进行多轮推断 * 强化学习的目的是让AI自行找出重组问题叙述和扩展思考空间的办法,也是超越人类的契机 14:22 强化学习回顾和Deepseek R1的创新 * 强化学习和基于样本的监督学习的区别是,样本学习最终是逼近样本,强化学习学习成功策略,可以超越原有已知策略 * 强化学习目前主流是actor critic模式,一个学习策略,一个学习评估局势,两个模型互相训练 * Deepseek R1去掉了critic,同时用数学和代码数据集训练推理过程,然后直接用规则方式评估局势,因为数学和代码训练集更容易量化和具备确定性。一个比喻是用数学和编程的专科训练来提高AI逻辑思维能力 * 提示词工程对reasoning模型的意义和SFT模型意义不同,反而是思考路线限制越少越好,因为思考路线是强化学习训练的成果 24:56 总结 * reasoning AI是新工作 * deepseek的开源意义重大,但deepseek很难被复制 * reasoning AI是强化学习驱动训练的,有机会超越人类,类比AlphaGo和AlphaZero
思考快与慢08投资现在还是投资未来时间领主思考方式开车的路上经常会听一些有声读物和录播课程。基于费曼学习法,为了让一些有价值的知识记忆更牢固,特意在汽车人茶馆社区和朋友们分享自己的读书感悟。这里是剪辑录音版本。 本季分享的读物是Daniel Kahneman的著作Think Fast and Slow以及微信视频上王珞老师的商学院博弈论案例课程。
思考快与慢09分享会后的互动讨论开车的路上经常会听一些有声读物和录播课程。基于费曼学习法,为了让一些有价值的知识记忆更牢固,特意在汽车人茶馆社区和朋友们分享自己的读书感悟。这里是剪辑录音版本。 本季分享的读物是Daniel Kahneman的著作Think Fast and Slow以及微信视频上王珞老师的商学院博弈论案例课程。
思考快与慢07年轻人为什么选择躺平退出博弈开车的路上经常会听一些有声读物和录播课程。基于费曼学习法,为了让一些有价值的知识记忆更牢固,特意在汽车人茶馆社区和朋友们分享自己的读书感悟。这里是剪辑录音版本。 本季分享的读物是Daniel Kahneman的著作Think Fast and Slow以及微信视频上王珞老师的商学院博弈论案例课程。
思考快与慢06囚徒困境的破局开车的路上经常会听一些有声读物和录播课程。基于费曼学习法,为了让一些有价值的知识记忆更牢固,特意在汽车人茶馆社区和朋友们分享自己的读书感悟。这里是剪辑录音版本。 本季分享的读物是Daniel Kahneman的著作Think Fast and Slow以及微信视频上王珞老师的商学院博弈论案例课程。
思考快与慢05诚实策略老实人不吃亏开车的路上经常会听一些有声读物和录播课程。基于费曼学习法,为了让一些有价值的知识记忆更牢固,特意在汽车人茶馆社区和朋友们分享自己的读书感悟。这里是剪辑录音版本。 本季分享的读物是Daniel Kahneman的著作Think Fast and Slow以及微信视频上王珞老师的商学院博弈论案例课程。
思考快与慢04赢家诅咒开车的路上经常会听一些有声读物和录播课程。基于费曼学习法,为了让一些有价值的知识记忆更牢固,特意在汽车人茶馆社区和朋友们分享自己的读书感悟。这里是剪辑录音版本。 本季分享的读物是Daniel Kahneman的著作Think Fast and Slow以及微信视频上王珞老师的商学院博弈论案例课程。
思考快与慢03禀赋效应开车的路上经常会听一些有声读物和录播课程。基于费曼学习法,为了让一些有价值的知识记忆更牢固,特意在汽车人茶馆社区和朋友们分享自己的读书感悟。这里是剪辑录音版本。 本季分享的读物是Daniel Kahneman的著作Think Fast and Slow以及微信视频上王珞老师的商学院博弈论案例课程。
思考快与慢02控制错觉开车的路上经常会听一些有声读物和录播课程。基于费曼学习法,为了让一些有价值的知识记忆更牢固,特意在汽车人茶馆社区和朋友们分享自己的读书感悟。这里是剪辑录音版本。 本季分享的读物是Daniel Kahneman的著作Think Fast and Slow以及微信视频上王珞老师的商学院博弈论案例课程。
思考快与慢01引言开车的路上经常会听一些有声读物和录播课程。基于费曼学习法,为了让一些有价值的知识记忆更牢固,特意在汽车人茶馆社区和朋友们分享自己的读书感悟。这里是剪辑录音版本。 本季分享的读物是Daniel Kahneman的著作Think Fast and Slow以及微信视频上王珞老师的商学院博弈论案例课程。
白话CLIP多模态模型汽车人茶馆clubhouse新一期夜话,主讲人周志亮,大白话聊一聊多模态模型,如何把自然语言和图像连接起来。
评书版GPT技术解读与思考本期主讲人周志亮,以时间为线索回顾GPT的发展历史,重点讨论一个脑洞,关于Codex模型的意义,是否是GPT推理技能的基石,Codex引入的计算机语言,也就是程序代码使得AI可以在自己的世界里形成逻辑自洽,比如设计程序,运行程序,得到结果。之前的GPT3学习人类语言也许是不能产生这样的逻辑的。所以GPT-3.5是以code-davici-002开始的,而不是GPT3。
聊一聊chatGPT来自汽车人茶馆的沙龙夜话,主讲人周志亮,在2月初聊一聊GPT对社会的首次冲击