179: 蒸馏风暴:一场无人公开谈论的技术竞赛晚点聊 LateTalk

179: 蒸馏风暴:一场无人公开谈论的技术竞赛

50分钟 ·
播放数55845
·
评论数134

「关于蒸馏:误解、门槛与代价」

这期播客,又是一次“编辑部”节目:我和《晚点 LatePost》的主笔高洪浩一起来聊蒸馏。

这是一个所有人都在关注、却很少有人愿意公开谈论的话题,所以也很难邀请外部嘉宾。本期中,我们对蒸馏的讨论,来自过去一段时间,我们和数位来自不同中国 AI lab 的从业者的讨论以及一些公开资料。

相关文章蒸馏风暴:AI 公司不愿公开谈论的技术竞赛已在上周发布。

播客里,编辑了《晚点独家丨字节讨论训超 5 万亿参数模型,张一鸣:不蒸馏、别被 Coding 这种短期热点影响》的洪浩,也和我一起讨论了更多公司,如字节的更多做法和可能的原因。

蒸馏这种诞生多年的技术到底是什么?为何在 2026 年出圈?大规模蒸馏如何实现?蒸馏能否成为一个模型研发团队的壁垒?它的代价又是什么?

本期节目是一个引子,希望更多从业者、听友在评论区分享你们的想法、观察和思考。


图注:斩杀线。处在一个模型,右边(比它贵),和下方(智能程度比它低)区域的模型,被该模型”斩杀“。不过这个图里没有反映另一个非常重要的维度,就是推理速度。

本期嘉宾:
程曼祺,《晚点 LatePost》科技报道负责人

本期主播:
高洪浩,《晚点 LatePost》主笔

本期剪辑:甜食

时间线:
-蒸馏不是“抄答案”,蒸馏为何在 2026 年出圈
02:04 典型蒸馏:让学生模型逼近教师的输出行为
04:26 智能体轨迹蒸馏:可被“蒸”的数据越来越丰富
06:41 不是所有使用强模型输出的训练都是蒸馏,但都违反用户协议
08:05 蒸馏规模扩大的两个关键节点
10:17 从为了压缩,到为了变强

-字节为什么不蒸馏?
13:51 张一鸣的判断:最多只能逼近,很难真正超越
17:44 一个运动员可以既嗑兴奋剂,也勤加训练吗?
24:41 其它公司的蒸馏讨论

-蒸馏难在哪,如何实现?
28:52 账号、真实问题与数据管线:大规模蒸馏的 know-how
32:08 蒸馏行为可以被隐藏吗?
34:56 学生模型超越教师模型的可能性
37:29 一直逼近而不超越,问题是什么?

-学生能否超过教师:技术、规则与更大的商业问题
38:35 蒸馏的红线与“双标”争议
44:05 更便宜的智能,如何改变前沿模型商业逻辑

相关链接:

蒸馏风暴:AI 公司不愿公开谈论的技术竞赛

晚点独家丨字节讨论训超 5 万亿参数模型,张一鸣:不蒸馏、别被 Coding 这种短期热点影响

177 期:详解 Kimi K3:强到冲击 Anthropic 估值的模型什么样?

176 期:姚顺雨,来到腾讯 300 天

163 期:详解 DeepSeek V4:Infra 巨鲸、百万上下文走进现实、极致效率优化

80 期:OpenAI o1 来了!与硅流袁进辉聊 o1 新范式和开发者生态

Anthropic:Detecting and preventing distillation attacks

Google Threat Intelligence Group:Distillation, Experimentation, and (Continued) Integration of AI for Adversarial Use

DeepSeek-R1 技术报告

OpenAI 使用条款

小红书@曼祺_火柴Q即刻@曼祺_火柴Q

小红书@高洪浩 ALaNGo 即刻@高洪浩 ALaNGo

☆《晚点聊 LateTalk》建立「 播客听友群」啦!☆

欢迎关注科技、商业大公司动态和创业创新的小伙伴进群交流,第一时间收听新节目。
这里有更多互动,更多话题讨论。欢迎贡献选题 & 推荐嘉宾。

请先添加「晚点」小助手的微信号,备注:“晚点聊”,我们邀请您入群。

关注公众号《晚点 LatePost》和《晚点对话》,阅读更多商业、科技文章:

展开Show Notes
置顶
我看评论区提到的洪浩提问方式,这是一种采访方法:就是抛出一些常见想法、偏见、误解。这类我们自己录的播客是会提前对一个脉络的:大概要涉及哪些议题和如何展开提问等。

想听到更多晚点编辑部讨论行业议题的播客的朋友们,不要吝惜你们的好感,多鼓励我们更多同事一起来录!晚点还有不少长期(十年)跟踪一些领域和公司的资深作者,他们有很多观察和故事😁
神经蛙_YhvU:我反而很喜欢这次访谈,虽然大家对洪浩的提问方式提出了质疑,但是对于我这样一个技术小白来讲,主持人和嘉宾的互动帮我澄清了很多误解,也让我愿意继续看晚点的其他博客,感谢洪浩和曼祺
Apeman:可以说是采取的一种提问方式,这倒没什么。主要是随着对话和主题的深入,提问者也依旧还停留在话题最开始时候的思考与想法,依旧想要按照自己的想法去套话。
48:18 本集男嘉宾由字节冠名提供
银蓝228:哈哈哈哈哈哈哈哈
wz_g2G1:哈哈哈哈哈哈哈哈哈哈
共3条回复
JaimeX
JaimeX
2026.8.17
男主持人精力在收集情报,对模型训练理解有点少
阿白er
阿白er
2026.8.17
这个男主持人的倾向🤣
ChaosMars
ChaosMars
2026.8.18
男主持人不懂可以不聊
水度747:捧哏嘛 理解一下
其实从命名上就有不错的类比呀, Teacher Student 就理解为辅导班嘛,抄答案的时候只有问题和答案,但是蒸馏的轨迹里等于老师做题的思路,让学习轨迹比对答案自己学更平滑
曼祺_MatchQ
:
是的 这个比较合适,当时没想到特别像的
林振强的迷弟陈:我觉得做题思路这些对人来说是需要学习花费很多精力的,而对于模型来说应该和记答案的成本是不是差不多?所以是不是还是更像门槛更高的抄答案?
共3条回复
哇!第一次听曼祺主输出,逻辑好清晰啊!爱听多讲🥳
程楚楚:北大才女
乐Yue言:難怪
这期播客,又是一次“编辑部”节目:我和《晚点 LatePost》的主笔高洪浩一起来聊蒸馏。

这是一个所有人都在关注、却很少有人愿意公开谈论的话题,所以很难邀请外部嘉宾。相比文章,我和洪浩在播客中一起讨论了更多公司的做法和实践,如字节为什么不蒸馏,带来的后续动作和影响等。

(剪辑回听时,也被自己的雷霆笑声闪到了。。。“我们是专业的,除非忍不住”。)
曼祺_MatchQ
:
是什么人最开始发现大规模蒸馏实践的?一个“亦正亦邪”的主人公,他是一些人眼里的小偷,一些人眼里的普罗米修斯,一个无名的“罪人”或罗宾汉。(没人想要这个 credit)
神经蛙_EsxD:自己那么多免费用户,有了一手数据,干嘛要二手数据?
共6条回复
HD962322y
HD962322y
2026.8.18
女主持人说话很理性。从这个分享我也学到了很多
ouyazhaozha
ouyazhaozha
2026.8.17
孔子说,学而不思则罔,思而不学则殆,就是对直接经验的反思和对间接经验的吸收都有意义。直接经验和间接经验在不同的语境下的边界是在变化的,他们的作用也在浮动。对于大语言模型来说,直接经验是任何符合基本逻辑的语料,间接经验就是高质量的逻辑完整精确的语料。蒸馏无非是因为人类创造的高质量语料相对还是稀缺的,不能认为对间接经验就只有照单全收而缺乏反思理解。从技术角度,我觉得恰当地使用蒸馏是合理且必要的;从商业角度,就得看法律法规和监管行为了。
penny_CKXF:大模型不就是蒸馏了前人的大数据吗?贼喊捉贼?文艺复兴本质就是西方蒸馏了大量的伊斯兰文明成果。
leom_dGYL
leom_dGYL
2026.8.18
蒸馏最早在深度学习时代就出现了,传统的蒸馏是把教师模型和学生模型一起训练的,需要大量的数据集。在大模型这种大规模数据集里面,在拿不到封闭模型作为教师模型一起训练,仅仅只是从前沿模型里面捞一些数据集,这个量是远远小于训练集的,效果有提升,但也没有大家想象的那么大。现在大家太神话蒸馏,只靠蒸馏还不够。然后还有一个问题,像我会在同一个项目里面用多个模型,那在使用模型的时候,会把数据回传给大模型公司,它会用来训练,那传回的代码数据里面有一部分就是一元模型公司写的,但是开源模型公司并不知道,那这个时候他用的闭源模型公司写的代码,开源模型公司并不知道,但本质上这也是真牛,那这怎么算?那反过来呢?闭源模型公司也会拿到开源模型公司写的代码,那是不是闭源模型公司也蒸馏了开源模型公司?
曼祺_MatchQ
:
不过,能拿到数据不一定会用这些数据来蒸馏。比较典型的蒸馏,是用自己的模型去模拟想学的那个模型的输出行为。有些情况下,可能只是拿到了对方的一些公开数据,这些数据不管是数据量上还是类型上,可能都无法用来做蒸馏。
感觉对于用户来讲,大家主要是认为蒸馏是一种“走捷径”,尤其是在大模型领域,因为本质就是输入输出,而且是在比较硬核的科技领域,就更会放大走捷径的感觉。但要是换一个领域,比如有一套高考数学辅导材料,对家看你出的好,买的好,就买来自己看来模仿着出,包括衣服的款式之类的,大家都会觉得是比较常见的,但在大模型领域,这种走捷径的观点就是会被放大,因为大家都希望是科技的进步,而不是蒸馏,大家希望是你艺术的创作,而不是看别人家的好就拿过来,音乐也是这样子,而且这种走捷径还能带来商业利益
Kailin_M5zT:我外行,感觉是这样的,就是换一个领域的场景使用和换一个词汇就一直在聊,感觉Ai行业很爱这样,用一些什么agent之类的词。
舍巴斯基:看更在乎什么东西了,如果更在乎廉价地提供智能,那蒸馏确实是“捷径”,就好像你说的题目、衣服一般都抄着出就完了,但如果更在乎提高机器智能的上限,那蒸馏似乎不可行
小逸Louie
小逸Louie
2026.8.18
42:12 感谢曼祺姐的这期播客,是对公众号文章的重要补充。这里写到的15亿美元和解案之前有关注,在这里贴一下:

Anthropic在2024年启动了内部称为 Project Panama的项目,花费数千万美元批量购买数百万本纸质书,切掉书脊,用工业扫描设备逐页数字化,再将切散的纸页交给回收公司。项目文件甚至写着“destructively scan all the books in the world”,但这是内部夸张式项目表述。

不过,15亿美元和解并不是为这些买来后扫描、销毁的纸质书支付的。而是罚的下载盗版电子书。

把实体书拆了+扫描了+数字化+然后扔了其实不触犯美国法律的,即使这其中可能涉及到一些孤品小众书籍。

然后呢,现在Anthropic给Claude生成的文本加了水印。
曼祺_MatchQ
:
对 实体书他们是购买的,盗版书是没付钱直接下载的。
小逸Louie:是的
共3条回复
神奇小鲸
神奇小鲸
2026.8.17
10:05 sorry, honghao听起来对蒸馏这种技术还不太懂?10分钟里manqi纠正了好几处理解上的偏差,我听起来还是有点累,对行业内听众来说不太友好
曼祺_MatchQ
:
这是为了厘清一些常见的想法设置的问题。“抄作业”等确实是常见看法。
ceci_hVih:是的
Mr_Curiosity
Mr_Curiosity
2026.8.17
38:40 这里关于 RSI 让公司间区别不断放大还需要有一个假设即模型能力提升的曲线是没有瓶颈的,以及外部资源包括算力和电力等还可以进一步指数 scale。如果 ASI 后模型能力因为一些约束而放缓,其他公司也可以追上,因为人的作用没那么大了。
HD397173i
HD397173i
2026.8.18
关于加州法院对Anthropoic那个判例,想补充一点的是,Anthropic最后给原作者的版权费只针对在美国有版权的作者。所以他们盗用的美国以外所有作品都是没有付费的。加州政府想要保护本地企业也是很明显了
Guson_Z
Guson_Z
2026.8.18
怎么一直强调字节不蒸馏😃翻来覆去的讲,字节真的不蒸馏吗
曼祺_MatchQ
:
张一鸣自己全员会说的事还是说明做了不蒸馏的选择。
MMMMM1234:因为他的算力不允许
共3条回复
J_Lock
J_Lock
2026.8.17
我印象中,蒸馏不是这两年的概念。我第一次接触蒸馏是在视觉领域,当时为了满足实时性需求,让模型在保持或牺牲一点的精度的情况下,使用蒸馏、剪枝、量化等操作,让模型变小。
Teacher- Student,在文本领域刚开始是为了提高训练效率,老师模型用自己的“经验”,让学生模型少走很多弯路,使得学生模型学习的更快
J_Lock:评论早了,刚评论完就听见讲了这个事情😂
青雲古月
青雲古月
2026.8.18
46:01 现在 v4 flah 已经没有性价比了
曼祺_MatchQ
:
😅涨价后 “滑动变祖器”像左移动了一些
鸳鸯走柠
鸳鸯走柠
2026.8.17
就听曼琪解释环境这个概念,就很佩服曼琪。因为这听起来不像是念稿,而是完全即时从大脑里面提取出来的内容。
曼祺_MatchQ
:
这是写了要点的。即时说,这类比较技术的解释我就说的不准确。