面试人的想到的 —— 看他身上有没有两样东西的影子:帕累托最优,和递归贝叶斯。
背后站着两条完全不同的人生走法。帕累托最优说的是:到了这个点就别再动了,而且最优永远是给定约束下的最优——所以说不出自己放弃了什么的人,多半是把别人的最优解当成了自己的标准答案。贝叶斯说的是另一件事:先验被证据修正成后验,后验又成为下一轮的先验,一边走一边改,所有结论都是暂时的。这两条路线在 AI 的训练车间里有一组精确的对应物,SFT 和 RL:一个是照着标准答案模仿,天花板就是写答案的那个人;一个是只定义什么算好,剩下的自己去试。
- ` 面试新人时我给自己加的一条标准:看他身上有没有那两样东西的影子
- 01:41 三个听上去很普通的问题,各有各的对象
- 03:53 帕累托最优:到了这个点就别再动了;而最优永远是给定约束下的最优
- 05:58 说不出自己放弃了什么的,多半是把别人的最优解当成了标准答案
- 06:57 贝叶斯:先验、后验,一边走一边改,所有结论都在等下一份证据
- 09:09 真复盘讲得出变化量:我原来以为是 A,后来把判断改成了 B
- 09:51 两种范式:帕累托是停的学问,贝叶斯是改的学问
- 11:33 标准答案给你的从来不是知识,是安全感
- 12:06 SFT 与 RL:老师教学生,和规则之下的自学
- 13:32 模仿只能逼近,试错才能超越;而顺序是先 SFT 打底,再 RL 拉上限
- 14:52 战场上的奖励函数:乌克兰无人机部队的 e 积分
- 16:49 只定义奖励,不定义动作;代价是指挥部必须容忍混乱
- 18:29 步兵从 2 分调到 6 分,整个前线的火力分配随之转向
- 19:14 杨植麟:管一个团队要用 RL 的方式,而不是 SFT
- 20:09 对照我自己:改到放心为止,我买的是自己的安全感
- 21:11 古德哈特定律:一个指标一旦成为目标,它就不再是一个好指标
- 23:22 SFT 是很好的先验,管理者最难的不是教,是管住自己的手
- 24:10 科举:一千三百年的 SFT,八股文是最古老的 reward hacking
- 25:40 普鲁士学校与流水线:学校和工厂本来就是一对
- 26:49 波普尔:科学是人类文明跑了四百年的强化学习
- 28:08 替 SFT 说句公道话:模仿是地基,错的是把地基当成了房子
- 29:02 成年之后没人再发标准答案,而 AI 是把标准答案学完的那个学生
- 30:05 我想听的不是省了多少时间,是他回去改的是稿子,还是自己给出的标准
- 31:15 给自己造反馈回路:短周期,可验证,然后承担试错的成本
- 33:36 帕累托式的人把最优解当终点,贝叶斯式的人把同一个解当先验
- 35:04 横截面归帕累托,轨迹归贝叶斯;答案不在 or 里,在那个乘号里

