EP12 人生轨迹的贝叶斯 or 帕累托何以至此

EP12 人生轨迹的贝叶斯 or 帕累托

40分钟 ·
播放数14
·
评论数0

面试人的想到的 —— 看他身上有没有两样东西的影子:帕累托最优,和递归贝叶斯。
背后站着两条完全不同的人生走法。帕累托最优说的是:到了这个点就别再动了,而且最优永远是给定约束下的最优——所以说不出自己放弃了什么的人,多半是把别人的最优解当成了自己的标准答案。贝叶斯说的是另一件事:先验被证据修正成后验,后验又成为下一轮的先验,一边走一边改,所有结论都是暂时的。这两条路线在 AI 的训练车间里有一组精确的对应物,SFT 和 RL:一个是照着标准答案模仿,天花板就是写答案的那个人;一个是只定义什么算好,剩下的自己去试。

- 00:30` 面试新人时我给自己加的一条标准:看他身上有没有那两样东西的影子

- 01:41 三个听上去很普通的问题,各有各的对象

- 03:53 帕累托最优:到了这个点就别再动了;而最优永远是给定约束下的最优

- 05:58 说不出自己放弃了什么的,多半是把别人的最优解当成了标准答案

- 06:57 贝叶斯:先验、后验,一边走一边改,所有结论都在等下一份证据

- 09:09 真复盘讲得出变化量:我原来以为是 A,后来把判断改成了 B

- 09:51 两种范式:帕累托是停的学问,贝叶斯是改的学问

- 11:33 标准答案给你的从来不是知识,是安全感

- 12:06 SFT 与 RL:老师教学生,和规则之下的自学

- 13:32 模仿只能逼近,试错才能超越;而顺序是先 SFT 打底,再 RL 拉上限

- 14:52 战场上的奖励函数:乌克兰无人机部队的 e 积分

- 16:49 只定义奖励,不定义动作;代价是指挥部必须容忍混乱

- 18:29 步兵从 2 分调到 6 分,整个前线的火力分配随之转向

- 19:14 杨植麟:管一个团队要用 RL 的方式,而不是 SFT

- 20:09 对照我自己:改到放心为止,我买的是自己的安全感

- 21:11 古德哈特定律:一个指标一旦成为目标,它就不再是一个好指标

- 23:22 SFT 是很好的先验,管理者最难的不是教,是管住自己的手

- 24:10 科举:一千三百年的 SFT,八股文是最古老的 reward hacking

- 25:40 普鲁士学校与流水线:学校和工厂本来就是一对

- 26:49 波普尔:科学是人类文明跑了四百年的强化学习

- 28:08 替 SFT 说句公道话:模仿是地基,错的是把地基当成了房子

- 29:02 成年之后没人再发标准答案,而 AI 是把标准答案学完的那个学生

- 30:05 我想听的不是省了多少时间,是他回去改的是稿子,还是自己给出的标准

- 31:15 给自己造反馈回路:短周期,可验证,然后承担试错的成本

- 33:36 帕累托式的人把最优解当终点,贝叶斯式的人把同一个解当先验

- 35:04 横截面归帕累托,轨迹归贝叶斯;答案不在 or 里,在那个乘号里