009. IQuest付杰:AI研究者与时间赛跑的十五年

009. IQuest付杰:AI研究者与时间赛跑的十五年

93分钟 ·
播放数143
·
评论数1

2010年那会儿,付杰在人人网上第一次听说“深度学习”。第二年他投了一篇用深度学习做图像匹配的论文,被拒了,审稿人说这东西“太经验主义”。他没纠结,转头就去做 kernel machine。两年后,ImageNet 比赛里,AlexNet 杀出来,深度学习的这十年,就这么开了头。

到了2020年,朋友拉他一起搞语言模型,他想了很久,还是决定继续留在 Mila 做博后。同一年,GPT3 发布,大语言模型从此一路狂飙。

说起来,两次都站在风口边上,两次都没进去。付杰后来也承认,心里一直有个念头,就是想证明“我比大家更早看到”,只是当时没有懂得如何利用好工业界scaling的优势。所以现在,他戒糖、断食,想方设法“延缓衰老”,想把错过的时间,在下一个路口抢回来。他觉得目前对于safe AI来说,梯度下降最陡的一个方向是如何让“验证”变得便宜且可靠。

这次聊天里,他特别想聊清楚一个事:measure 和 verify,看着差不多,其实是两码事。他也慢慢放下了“什么东西都得形式化”的执念。至于机制可解释性到底能不能兑现当初那些承诺,他还在摸索。说到底,这就是一个AI研究者跟自己较劲、跟时间赛跑的十五年。

欢迎关注同名小红书“AI实话实说”,加入群组和嘉宾、主持人互动!

相关术语

Verification:验证。判断一个系统的结果是否真正满足人类的目标、约束和安全要求,而不只是某个分数是否更高。

Verification Cost:验证成本。确认结果正确、安全和符合真实意图所需要的时间、算力、实验与人力成本。

Formal Verification:形式化验证。把要求写成严格的形式语言,再通过程序或证明系统验证软件、算法或行为是否满足这些要求。

Autoformalization:自动形式化。将自然语言中的问题、规则和需求自动转换成 Lean、Dafny 等形式语言中的严格命题。

Verifier:验证器。检查 AI 的答案、计划或行为是否满足规范的系统。在理想情况下,它需要与被监督的 AI 同样强,甚至更强。

Mechanistic Interpretability:机制可解释性。研究模型内部的神经元、回路与状态如何产生具体能力和行为。

Swiss Cheese Model:瑞士奶酪模型。任何单一安全机制都有漏洞,因此需要多层防御,让不同层的漏洞尽量不在同一位置重合。

Recursive Self-improvement:递归式自我改进。AI 参与改进自身或下一代 AI 的过程。其关键瓶颈之一,是能否获得持续、可靠且低成本的验证信号。

快速跳转

02:02 IQuest 付杰登场:轻断食、延缓衰老,以及为什么每天都在怀疑自己

04:21 前沿研究为什么越来越难获得反馈? Verification 的稀缺

10:51 Verifier、World Model 与 Safety Specification 如何共同构成安全防线?

17:21 “AI also means 爱”:如果无法控制更强的 AI,人类能否让它学会爱与共情?

21:42 Verification 一定比 Generation 容易吗?计算复杂度与不可约性

28:40 穿越四次 AI 浪潮:为什么他一次次提前看到,又一次次错过?

35:20 从“证明我看得早”到 “Scaling What Works”:对过去研究路径的反思

40:05 降低 Verification Cost:为什么安全既是防御工具,也可能加速 AI 进化?

46:03 从机制可解释性到形式化验证:如何让黑盒模型变得更透明、更可靠?

1:06:58 形式化验证与自动形式化:如何把自然语言问题放进一个每一步都可检查的形式世界?

1:18:35 从软件到 Agent,再到 AI for Science:哪些行为能够被验证,如何防止模型钻规则的漏洞?

1:30:35 理想的验证系统、AI 取代焦虑与最后的结论:Verification is the GOAT

展开Show Notes
271490219
271490219
1 天前
29:21 不是 这个地方居然没有评论吗🤣🥲🫠