2010年那会儿,付杰在人人网上第一次听说“深度学习”。第二年他投了一篇用深度学习做图像匹配的论文,被拒了,审稿人说这东西“太经验主义”。他没纠结,转头就去做 kernel machine。两年后,ImageNet 比赛里,AlexNet 杀出来,深度学习的这十年,就这么开了头。
到了2020年,朋友拉他一起搞语言模型,他想了很久,还是决定继续留在 Mila 做博后。同一年,GPT3 发布,大语言模型从此一路狂飙。
说起来,两次都站在风口边上,两次都没进去。付杰后来也承认,心里一直有个念头,就是想证明“我比大家更早看到”,只是当时没有懂得如何利用好工业界scaling的优势。所以现在,他戒糖、断食,想方设法“延缓衰老”,想把错过的时间,在下一个路口抢回来。他觉得目前对于safe AI来说,梯度下降最陡的一个方向是如何让“验证”变得便宜且可靠。
这次聊天里,他特别想聊清楚一个事:measure 和 verify,看着差不多,其实是两码事。他也慢慢放下了“什么东西都得形式化”的执念。至于机制可解释性到底能不能兑现当初那些承诺,他还在摸索。说到底,这就是一个AI研究者跟自己较劲、跟时间赛跑的十五年。
欢迎关注同名小红书“AI实话实说”,加入群组和嘉宾、主持人互动!
相关术语
Verification:验证。判断一个系统的结果是否真正满足人类的目标、约束和安全要求,而不只是某个分数是否更高。
Verification Cost:验证成本。确认结果正确、安全和符合真实意图所需要的时间、算力、实验与人力成本。
Formal Verification:形式化验证。把要求写成严格的形式语言,再通过程序或证明系统验证软件、算法或行为是否满足这些要求。
Autoformalization:自动形式化。将自然语言中的问题、规则和需求自动转换成 Lean、Dafny 等形式语言中的严格命题。
Verifier:验证器。检查 AI 的答案、计划或行为是否满足规范的系统。在理想情况下,它需要与被监督的 AI 同样强,甚至更强。
Mechanistic Interpretability:机制可解释性。研究模型内部的神经元、回路与状态如何产生具体能力和行为。
Swiss Cheese Model:瑞士奶酪模型。任何单一安全机制都有漏洞,因此需要多层防御,让不同层的漏洞尽量不在同一位置重合。
Recursive Self-improvement:递归式自我改进。AI 参与改进自身或下一代 AI 的过程。其关键瓶颈之一,是能否获得持续、可靠且低成本的验证信号。
快速跳转
IQuest 付杰登场:轻断食、延缓衰老,以及为什么每天都在怀疑自己
前沿研究为什么越来越难获得反馈? Verification 的稀缺
Verifier、World Model 与 Safety Specification 如何共同构成安全防线?
“AI also means 爱”:如果无法控制更强的 AI,人类能否让它学会爱与共情?
Verification 一定比 Generation 容易吗?计算复杂度与不可约性
穿越四次 AI 浪潮:为什么他一次次提前看到,又一次次错过?
从“证明我看得早”到 “Scaling What Works”:对过去研究路径的反思
降低 Verification Cost:为什么安全既是防御工具,也可能加速 AI 进化?
从机制可解释性到形式化验证:如何让黑盒模型变得更透明、更可靠?
形式化验证与自动形式化:如何把自然语言问题放进一个每一步都可检查的形式世界?
从软件到 Agent,再到 AI for Science:哪些行为能够被验证,如何防止模型钻规则的漏洞?
理想的验证系统、AI 取代焦虑与最后的结论:Verification is the GOAT
