E483. 亚马逊AGI查晟:大模型训练的一线实践;训练AI有多难,人才和科学精神有多重要?课代表立正

E483. 亚马逊AGI查晟:大模型训练的一线实践;训练AI有多难,人才和科学精神有多重要?

55分钟 ·
播放数159
·
评论数0

大模型训练不是堆算力就能解决的问题。Amazon AGI 资深经理查晟从一线实践拆解实验设计、数据、基础设施、Evaluation 与团队协作,并解释为什么追求 information gain 的团队反而要容许高失败率。

适合大模型训练、机器学习基础设施和 AI 研究从业者,也适合需要判断行业能力边界的人,帮助你区分模型研发中的科学问题、工程瓶颈与组织约束。

这期你会听到

• 为什么大模型训练必须同时做好数据、模型、分布式系统与 Evaluation?

• 高失败率实验如何带来更高的 information gain?

• 公开 benchmark 为什么可能被数据泄漏和刷分误导?

• cost-to-accuracy 如何衡量不同周期的真实研发进展?

• NVIDIA 的护城河为什么不仅来自硬件,还来自 compiler 与软件栈?

章节

00:00 — 高信息增益实验为何允许失败

01:14 — 查晟与 Amazon AGI 的模型训练实践

02:23 — 大模型训练为何是系统工程

07:47 — 用失败率检验研究方向的信息增益

09:05 — 模型、数据、基础设施如何协同交付

15:15 — 数据质量、SEO 垃圾与合成数据边界

21:04 — Evaluation 为何关键又容易失真

29:57 — 用 cost-to-accuracy 衡量研发进展

36:01 — 稀缺人才与 NVIDIA 的软件护城河

39:26 — 模型自主学习可能带来的下一步突破

45:33 — AI 对职业与经济关系的冲击

53:33 — 回到科学精神与完整训练系统

本期嘉宾

查晟,Amazon AGI 资深经理,参与亚马逊第一代大模型研发及 Frontier 模型训练,并曾与 Alex Smola、李沐共事。

相关内容

观看本期视频版

阅读本期文字稿

查晟:大模型训练的真相、NVIDIA 的护城河、以及为什么大厂做不好 AI:

youtu.be

加入Superlinear Academy免费社区

提交正在设计的模型实验,交代假设、评估方式与失败信号,请大家寻找信息增益更高的改法。

www.superlinear.academy

关于主播与节目

孙煜征(课代表立正),康奈尔大学经济学博士、Superlinear Academy创始人。曾任Amazon经济学家、Meta数据科学家和腾讯IEG副总监,也是OpenAI收购团队早期成员。

《课代表立正》关注AI如何改变工作、职业与商业,以及人在变化中最需要保留的判断力。