#668.AI领域的下一个百倍增长:推理、网络与自我优化模型

#668.AI领域的下一个百倍增长:推理、网络与自我优化模型

97分钟 ·
播放数600
·
评论数0

📝 本期播客简介

本期我们克隆了:知名 AI 工程播客 Latent Space Next 100x in AI: Inference, Networking, & Self-Optimizing Models — Philip Kiely & Ali Taha, Baseten

原内容更新时间:2026-08-03

本期节目由 Latent Space 主持人 swyx 与 Baseten 的资深推理工程师 Philip Kiely 和 Ali Taha 共同呈现,深入探讨了推理工程这一 AI 底层环节的实战内幕。节目围绕新模型发布后如何从“能跑”变成“跑得快又稳”展开,涉及量化、投机解码、模型并行等硬核话题,也聊到了模型自我优化这类前沿趋势。

对话从一次 20 万 token 的长查询如何被路由、缓存、预填充和解码开始,逐步拆解了推理服务商在支持新模型时面临的真实挑战。两位嘉宾不仅分享了 Baseten 在 GLM-5.2、Kimi K3 等模型上的优化实践,还大胆预测了 GPU 向 ASIC 演进、KV 缓存压缩、持续学习等未来方向。无论你是 AI 工程师、创业者还是对底层技术充满好奇的听众,这期节目都能让你对 AI 基础设施有全新的认识。

👨‍⚕️ 本期嘉宾

Philip Kiely 是 Baseten 的资深推理工程师,著有《推理工程》一书,长期专注于推理系统的性能优化与架构设计。Ali Taha 同样是 Baseten 的资深推理工程师,在视频扩散模型、GPU 内核优化等领域有深入研究。两位嘉宾都身处推理工程的第一线,亲历了从 Ampere 到 Blackwell 的硬件迭代,对量化、投机解码、模型并行等技术有丰富的实战经验。他们的分享不仅包含理论框架,更有大量来自生产环境的真实案例和判断。

⏱️ 时间戳

00:00 开场 & 播客简介

节目介绍与嘉宾登场

00:35 本期克隆节目介绍:Latent Space 推理工程深度对谈

02:37 嘉宾 Philip 与 Ali 的自我介绍与“滑铁卢实习生”昵称趣谈

长查询的旅程:从路由到解码

03:53 20 万 token 长查询在 Baseten 推理服务中的完整流程

04:16 缓存感知路由与分离式预填充/解码

05:21 投机解码如何加速长查询场景

从“支持”到“生产就绪”:新模型背后的工程

13:26 新模型发布后推理工程的工作量

14:22 推理速度竞赛与“支持”的两种含义

15:29 量化、投机解码器训练与基础设施搭建

模型改造与开源的力量

17:20 为 GLM-5.2 嫁接 Kimi 视觉编码器的实验

20:10 开源组件组合的潜力与“弗兰肯斯坦式合并”

21:33 从其他模型改装层:MiniMax M3 的实践

质量、量化与性能的平衡

27:12 保持模型质量的标准与方法

30:11 量化是否可能让模型变得更好

31:19 Baseten 的量化研究:误差抵消与 20% 吞吐提升

性能提升的极限与硬件演进

33:56 从每秒 70 token 到 10 倍提升的路径

38:42 投机解码与量化带来的 95% 性能收益

41:34 Dynamo 与 KV 缓存卸载的未来

模型并行与硬件趋势

50:15 张量并行与专家并行的原理与区别

55:33 Mega kernels 的争议与 GPU 向 ASIC 演进

59:54 推理工程正变成纯粹的基础设施问题

视频、音频与多模态推理

01:10:57 视频扩散模型的推理挑战与 token 瓶颈

01:15:05 自回归视频模型的优缺点与未来

01:19:20 音频推理:自回归与扩散的权衡

训练与推理的融合

01:24:42 推理服务于训练:强化学习中的 rollout 优化

01:25:32 训练服务于推理:量化感知训练与蒸馏

01:26:24 持续改进系统与模型自我优化

未来趋势与总结

01:30:02 推理工程的下一个前沿:系统层面与多模型组合

01:31:27 更快的网络芯片通信与 KV 缓存传输瓶颈

01:32:34 持续学习与 KV 缓存压缩的潜力

🌟 精彩内容

💡 “我们推理引擎里跑 GLM-5.2 用的有些 GPU 内核,就是 GLM-5.2 自己写的。”

Baseten 内部已经将 GLM-5.2 接入 Claude 代码框架,让模型自己分析性能跟踪、找出瓶颈内核并编写新内核。这标志着模型自我优化的循环已经从理论走向实践,尽管模型在决策能力上仍有局限。

“它会在节点上的 GLM-5.2 实例上做一次前向传播,然后拿到性能分析跟踪,自己分析,找出 SG lang 里的瓶颈内核,然后写新的内核。”

💡 “支持这个模型”和“支持这个模型”是有区别的——前者是我能让这个模型产出 token,后者是我能基于这个模型提供一个生产级 API。

让模型跑起来不难,难的是让它跑得又快又稳。量化、投机解码器训练、基础设施搭建、测试与修补,每一步都需要大量工程投入。新模型发布后的第一周、第一个月,都是持续优化和修 bug 的过程。

“真正的挑战在于,每家推理公司都有自己的专有技术栈,有些开源组件,有些是自研的。而且对任何一个新模型来说,总会有一些新东西。”

💡 量化更多的模型部分确实有可能让结果更好,因为量化误差相互抵消了。

Baseten 的研究团队通过数学验证,发现选择性地量化某些层可以让误差相互抵消,从而在提升吞吐的同时保持甚至提高模型保真度。这一发现打破了“量化越多越差”的传统认知。

“你最终得到的模型比其他提供商多量化了 20%。所以你获得了 20% 更多的吞吐,因为有更多层在跑 NVFP4。而且你的质量比别的量化版本更好。”

💡 推理会是一个值得长期做工程的地方,因为你在金融行业衡量提升是用基点,而我们发布优化成果的时候,是 20%,是 100%,是 200%。

与高度优化的金融领域相比,推理工程仍处于早期阶段,性能提升的空间巨大。当研究人员开始发论文说自己在某件事上提速了 1% 的时候,你就能知道推理基本上已经被做透了。

“我们追求的是大幅提速,而不是从 70 提到 90。”

💡 GPU 正在越来越像 ASIC。你只是在编排 GPU 上发生什么,而不是在逐线程控制它。

随着英伟达每一代 GPU 加入更多专用指令、专用张量核心,GPU 正沿着光谱朝硬件更专业化的方向演进。这对 AI ASIC 公司构成了挑战,但也意味着推理工程的重心正在从内核层面转向系统层面。

“你看英伟达把 GPU 从通用编程范式,就是一台你可以用来编程线程的通用计算机,每一代都在加入更多专用指令、专用张量核心、专用的 UMA 指令。”

💡 视频模型,你想生成高质量的视频。假设你做到 16 帧每秒,这是绝对的上限,然后假设你做 4K 视频。光是五秒钟的注意力计算,就要跑在三万五千个 token 上。

视频扩散模型的 token 数量惊人,注意力机制成为巨大瓶颈。Ali 认为,要突破五秒的帧数限制、生成好莱坞级别的电影,视频模型必须转向自回归架构,或者算力出现疯狂的大跃进。

“在我看来,它们只需要大幅扩展规模,并且转向自回归。但训练技术这方面,目前似乎还不清晰。”

💡 如果你能在理论上这个理想状态下,拥有极快的网络,理论上你就可以省掉 HBM 这一步,直接把 KV 缓存从一个节点传到另一个节点。

大规模推理服务中,KV 缓存的传输成为瓶颈。如果网络速度能接近 HBM,节点间的聚合推理服务将获得接近 100 倍的速度提升。这可能是推理工程下一个重大的突破方向。

“如果有人能解决这个问题,解码速度真的会快两个数量级。这就是我的看法。”

🌐 播客信息补充

本播客采用原有人声声线进行播客音频制作,也可能会有一些地方听起来怪怪的

使用 AI 进行翻译,因此可能会有一些地方不通顺;

如果有后续想要听中文版的其他外文播客,也欢迎联系微信:iEvenight