179: 蒸馏风暴:一场无人公开谈论的技术竞赛晚点聊 LateTalk

179: 蒸馏风暴:一场无人公开谈论的技术竞赛

50分钟 ·
播放数7057
·
评论数39

「关于蒸馏:误解、门槛与代价」

这期播客,又是一次“编辑部”节目:我和《晚点 LatePost》的主笔高洪浩一起来聊蒸馏。

这是一个所有人都在关注、却很少有人愿意公开谈论的话题,所以也很难邀请外部嘉宾。本期中,我们对蒸馏的讨论,来自过去一段时间,我们和数位来自不同中国 AI lab 的从业者的讨论以及一些公开资料。

相关文章蒸馏风暴:AI 公司不愿公开谈论的技术竞赛已在上周发布。

播客里,编辑了《晚点独家丨字节讨论训超 5 万亿参数模型,张一鸣:不蒸馏、别被 Coding 这种短期热点影响》的洪浩,也和我一起讨论了更多公司,如字节的更多做法和可能的原因。

蒸馏这种诞生多年的技术到底是什么?为何在 2026 年出圈?大规模蒸馏如何实现?蒸馏能否成为一个模型研发团队的壁垒?它的代价又是什么?

本期节目是一个引子,希望更多从业者、听友在评论区分享你们的想法、观察和思考。


图注:斩杀线。处在一个模型,右边(比它贵),和下方(智能程度比它低)区域的模型,被该模型”斩杀“。不过这个图里没有反映另一个非常重要的维度,就是推理速度。

本期嘉宾:
程曼祺,《晚点 LatePost》科技报道负责人

本期主播:
高洪浩,《晚点 LatePost》主笔

本期剪辑:甜食

时间线:
-蒸馏不是“抄答案”,蒸馏为何在 2026 年出圈
02:04 典型蒸馏:让学生模型逼近教师的输出行为
04:26 智能体轨迹蒸馏:可被“蒸”的数据越来越丰富
06:41 不是所有使用强模型输出的训练都是蒸馏,但都违反用户协议
08:05 蒸馏规模扩大的两个关键节点
10:17 从为了压缩,到为了变强

-字节为什么不蒸馏?
13:51 张一鸣的判断:最多只能逼近,很难真正超越
17:44 一个运动员可以既嗑兴奋剂,也勤加训练吗?
24:41 其它公司的蒸馏讨论

-蒸馏难在哪,如何实现?
28:52 账号、真实问题与数据管线:大规模蒸馏的 know-how
32:08 蒸馏行为可以被隐藏吗?
34:56 学生模型超越教师模型的可能性
37:29 一直逼近而不超越,问题是什么?

-学生能否超过教师:技术、规则与更大的商业问题
38:35 蒸馏的红线与“双标”争议
44:05 更便宜的智能,如何改变前沿模型商业逻辑

相关链接:

蒸馏风暴:AI 公司不愿公开谈论的技术竞赛

晚点独家丨字节讨论训超 5 万亿参数模型,张一鸣:不蒸馏、别被 Coding 这种短期热点影响

177 期:详解 Kimi K3:强到冲击 Anthropic 估值的模型什么样?

176 期:姚顺雨,来到腾讯 300 天

163 期:详解 DeepSeek V4:Infra 巨鲸、百万上下文走进现实、极致效率优化

80 期:OpenAI o1 来了!与硅流袁进辉聊 o1 新范式和开发者生态

Anthropic:Detecting and preventing distillation attacks

Google Threat Intelligence Group:Distillation, Experimentation, and (Continued) Integration of AI for Adversarial Use

DeepSeek-R1 技术报告

OpenAI 使用条款

小红书@曼祺_火柴Q即刻@曼祺_火柴Q

小红书@高洪浩 ALaNGo 即刻@高洪浩 ALaNGo

☆《晚点聊 LateTalk》建立「 播客听友群」啦!☆

欢迎关注科技、商业大公司动态和创业创新的小伙伴进群交流,第一时间收听新节目。
这里有更多互动,更多话题讨论。欢迎贡献选题 & 推荐嘉宾。

请先添加「晚点」小助手的微信号,备注:“晚点聊”,我们邀请您入群。

关注公众号《晚点 LatePost》和《晚点对话》,阅读更多商业、科技文章:

展开Show Notes
曼祺_MatchQ
曼祺_MatchQ
15小时前
置顶
这期播客,又是一次“编辑部”节目:我和《晚点 LatePost》的主笔高洪浩一起来聊蒸馏。

这是一个所有人都在关注、却很少有人愿意公开谈论的话题,所以很难邀请外部嘉宾。相比文章,我和洪浩在播客中一起讨论了更多公司的做法和实践,如字节为什么不蒸馏,带来的后续动作和影响等。

(剪辑回听时,也被自己的雷霆笑声闪到了。。。“我们是专业的,除非忍不住”。)
哇!第一次听曼祺主输出,逻辑好清晰啊!爱听多讲🥳
程楚楚:北大才女
48:18 本集男嘉宾由字节冠名提供
JaimeX
JaimeX
12小时前
男主持人精力在收集情报,对模型训练理解有点少
Mr_Curiosity
Mr_Curiosity
13小时前
其实从命名上就有不错的类比呀, Teacher Student 就理解为辅导班嘛,抄答案的时候只有问题和答案,但是蒸馏的轨迹里等于老师做题的思路,让学习轨迹比对答案自己学更平滑
曼祺_MatchQ
:
是的 这个比较合适,当时没想到特别像的
林振强的迷弟陈:我觉得做题思路这些对人来说是需要学习花费很多精力的,而对于模型来说应该和记答案的成本是不是差不多?所以是不是还是更像门槛更高的抄答案?
阿白er
阿白er
13小时前
这个男主持人的倾向🤣
J_Lock
J_Lock
12小时前
我印象中,蒸馏不是这两年的概念。我第一次接触蒸馏是在视觉领域,当时为了满足实时性需求,让模型在保持或牺牲一点的精度的情况下,使用蒸馏、剪枝、量化等操作,让模型变小。
Teacher- Student,在文本领域刚开始是为了提高训练效率,老师模型用自己的“经验”,让学生模型少走很多弯路,使得学生模型学习的更快
J_Lock:评论早了,刚评论完就听见讲了这个事情😂
ouyazhaozha
ouyazhaozha
12小时前
孔子说,学而不思则罔,思而不学则殆,就是对直接经验的反思和对间接经验的吸收都有意义。直接经验和间接经验在不同的语境下的边界是在变化的,他们的作用也在浮动。对于大语言模型来说,直接经验是任何符合基本逻辑的语料,间接经验就是高质量的逻辑完整精确的语料。蒸馏无非是因为人类创造的高质量语料相对还是稀缺的,不能认为对间接经验就只有照单全收而缺乏反思理解。从技术角度,我觉得恰当地使用蒸馏是合理且必要的;从商业角度,就得看法律法规和监管行为了。
Mr_Curiosity
Mr_Curiosity
12小时前
38:40 这里关于 RSI 让公司间区别不断放大还需要有一个假设即模型能力提升的曲线是没有瓶颈的,以及外部资源包括算力和电力等还可以进一步指数 scale。如果 ASI 后模型能力因为一些约束而放缓,其他公司也可以追上,因为人的作用没那么大了。
声音好听
飞行卷饼
飞行卷饼
10小时前
太清晰了!感谢
神奇小鲸
神奇小鲸
14小时前
10:05 sorry, honghao听起来对蒸馏这种技术还不太懂?10分钟里manqi纠正了好几处理解上的偏差,我听起来还是有点累,对行业内听众来说不太友好
ceci_hVih:是的
曼祺_MatchQ
:
这是为了厘清一些常见的想法设置的问题。“抄作业”等确实是常见看法。
老庄_Ticp
老庄_Ticp
8小时前
接下来的战场很可能是把大模型缩小的能力,(可能是蒸馏自己)然后部署到端侧或者大型企业部署自己的大模型。然后定期维护大模型让其追上最先进的模型(也可以是定向训练大企业内部数据和工作流的能力)
J_Lock
J_Lock
12小时前
17:56 我感觉蒸馏可以超越Teacher模型,需要看Student模型厂商准备了多少高质量数据。但是蒸馏可能会在不经意间学习海外的一些“敏感”言论、思维,训练完的模型需要用工程手段来去监管。
瞎听瞎感受
瞎听瞎感受
14小时前
第一!
HD33933q
HD33933q
9小时前
后最后一个问题好有意思,模型智能的供需关系👍🏻
逍遥游_rirO:这个问题就是经济性的问题,对于生产工具而言,性价比高者最终一定会生出,而高级模型可能更贵,但使用者会变少
无聊的猪
无聊的猪
13小时前
欢迎本期节目的嘉宾,哈哈。感觉“蒸馏”没有错,错的是在别家明确禁止的情况下蒸馏别家模型
曼祺_MatchQ
:
说实话,你就算不蒸馏,用他们的输出来提升自己的竞争性模型也是他们禁止的。他们要禁止是为了自己的竞争优势(Anthropic 可能部分人也真心相信是为了避免强 AI 落入旁人之手的“危险”),其他人要绕开也是为了这个。这肯定会是一场博弈。我自己没法认为违反用户协议就一定错,他们的用户协议本身管得很宽泛。只能说带入两边立场都能理解。
Alexpunk
Alexpunk
2小时前
a通过中转站蒸馏b,半天发现是在蒸自己这种地狱笑话的主角是谁?😄
紫霸
紫霸
4小时前
33:35 做反制可以理解,但单纯防守拦不住,真正壁垒是持续迭代的底层能力,古往今来各个领域这种被蒸馏复刻的案例太多了。Ai行业目前在法律与产权方面界限太模糊,全球都没有清晰定论,这个得靠时间一点点推进,替原始Ai公司鸣不平,反制动作至少抬高了门槛,同时,也可以理解做蒸馏那一方的处境。
解题思路