📝 本期播客简介
本期我们克隆了:知名 AI 工程播客 Latent Space Next 100x in AI: Inference, Networking, & Self-Optimizing Models — Philip Kiely & Ali Taha, Baseten
原内容更新时间:2026-08-03
本期节目由 Latent Space 主持人 swyx 与 Baseten 的资深推理工程师 Philip Kiely 和 Ali Taha 共同呈现,深入探讨了推理工程这一 AI 底层环节的实战内幕。节目围绕新模型发布后如何从“能跑”变成“跑得快又稳”展开,涉及量化、投机解码、模型并行等硬核话题,也聊到了模型自我优化这类前沿趋势。
对话从一次 20 万 token 的长查询如何被路由、缓存、预填充和解码开始,逐步拆解了推理服务商在支持新模型时面临的真实挑战。两位嘉宾不仅分享了 Baseten 在 GLM-5.2、Kimi K3 等模型上的优化实践,还大胆预测了 GPU 向 ASIC 演进、KV 缓存压缩、持续学习等未来方向。无论你是 AI 工程师、创业者还是对底层技术充满好奇的听众,这期节目都能让你对 AI 基础设施有全新的认识。
👨⚕️ 本期嘉宾
Philip Kiely 是 Baseten 的资深推理工程师,著有《推理工程》一书,长期专注于推理系统的性能优化与架构设计。Ali Taha 同样是 Baseten 的资深推理工程师,在视频扩散模型、GPU 内核优化等领域有深入研究。两位嘉宾都身处推理工程的第一线,亲历了从 Ampere 到 Blackwell 的硬件迭代,对量化、投机解码、模型并行等技术有丰富的实战经验。他们的分享不仅包含理论框架,更有大量来自生产环境的真实案例和判断。
⏱️ 时间戳
开场 & 播客简介
节目介绍与嘉宾登场
本期克隆节目介绍:Latent Space 推理工程深度对谈
嘉宾 Philip 与 Ali 的自我介绍与“滑铁卢实习生”昵称趣谈
长查询的旅程:从路由到解码
20 万 token 长查询在 Baseten 推理服务中的完整流程
缓存感知路由与分离式预填充/解码
投机解码如何加速长查询场景
从“支持”到“生产就绪”:新模型背后的工程
新模型发布后推理工程的工作量
推理速度竞赛与“支持”的两种含义
量化、投机解码器训练与基础设施搭建
模型改造与开源的力量
为 GLM-5.2 嫁接 Kimi 视觉编码器的实验
开源组件组合的潜力与“弗兰肯斯坦式合并”
从其他模型改装层:MiniMax M3 的实践
质量、量化与性能的平衡
保持模型质量的标准与方法
量化是否可能让模型变得更好
Baseten 的量化研究:误差抵消与 20% 吞吐提升
性能提升的极限与硬件演进
从每秒 70 token 到 10 倍提升的路径
投机解码与量化带来的 95% 性能收益
Dynamo 与 KV 缓存卸载的未来
模型并行与硬件趋势
张量并行与专家并行的原理与区别
Mega kernels 的争议与 GPU 向 ASIC 演进
推理工程正变成纯粹的基础设施问题
视频、音频与多模态推理
视频扩散模型的推理挑战与 token 瓶颈
自回归视频模型的优缺点与未来
音频推理:自回归与扩散的权衡
训练与推理的融合
推理服务于训练:强化学习中的 rollout 优化
训练服务于推理:量化感知训练与蒸馏
持续改进系统与模型自我优化
未来趋势与总结
推理工程的下一个前沿:系统层面与多模型组合
更快的网络芯片通信与 KV 缓存传输瓶颈
持续学习与 KV 缓存压缩的潜力
🌟 精彩内容
💡 “我们推理引擎里跑 GLM-5.2 用的有些 GPU 内核,就是 GLM-5.2 自己写的。”
Baseten 内部已经将 GLM-5.2 接入 Claude 代码框架,让模型自己分析性能跟踪、找出瓶颈内核并编写新内核。这标志着模型自我优化的循环已经从理论走向实践,尽管模型在决策能力上仍有局限。
“它会在节点上的 GLM-5.2 实例上做一次前向传播,然后拿到性能分析跟踪,自己分析,找出 SG lang 里的瓶颈内核,然后写新的内核。”
💡 “支持这个模型”和“支持这个模型”是有区别的——前者是我能让这个模型产出 token,后者是我能基于这个模型提供一个生产级 API。
让模型跑起来不难,难的是让它跑得又快又稳。量化、投机解码器训练、基础设施搭建、测试与修补,每一步都需要大量工程投入。新模型发布后的第一周、第一个月,都是持续优化和修 bug 的过程。
“真正的挑战在于,每家推理公司都有自己的专有技术栈,有些开源组件,有些是自研的。而且对任何一个新模型来说,总会有一些新东西。”
💡 量化更多的模型部分确实有可能让结果更好,因为量化误差相互抵消了。
Baseten 的研究团队通过数学验证,发现选择性地量化某些层可以让误差相互抵消,从而在提升吞吐的同时保持甚至提高模型保真度。这一发现打破了“量化越多越差”的传统认知。
“你最终得到的模型比其他提供商多量化了 20%。所以你获得了 20% 更多的吞吐,因为有更多层在跑 NVFP4。而且你的质量比别的量化版本更好。”
💡 推理会是一个值得长期做工程的地方,因为你在金融行业衡量提升是用基点,而我们发布优化成果的时候,是 20%,是 100%,是 200%。
与高度优化的金融领域相比,推理工程仍处于早期阶段,性能提升的空间巨大。当研究人员开始发论文说自己在某件事上提速了 1% 的时候,你就能知道推理基本上已经被做透了。
“我们追求的是大幅提速,而不是从 70 提到 90。”
💡 GPU 正在越来越像 ASIC。你只是在编排 GPU 上发生什么,而不是在逐线程控制它。
随着英伟达每一代 GPU 加入更多专用指令、专用张量核心,GPU 正沿着光谱朝硬件更专业化的方向演进。这对 AI ASIC 公司构成了挑战,但也意味着推理工程的重心正在从内核层面转向系统层面。
“你看英伟达把 GPU 从通用编程范式,就是一台你可以用来编程线程的通用计算机,每一代都在加入更多专用指令、专用张量核心、专用的 UMA 指令。”
💡 视频模型,你想生成高质量的视频。假设你做到 16 帧每秒,这是绝对的上限,然后假设你做 4K 视频。光是五秒钟的注意力计算,就要跑在三万五千个 token 上。
视频扩散模型的 token 数量惊人,注意力机制成为巨大瓶颈。Ali 认为,要突破五秒的帧数限制、生成好莱坞级别的电影,视频模型必须转向自回归架构,或者算力出现疯狂的大跃进。
“在我看来,它们只需要大幅扩展规模,并且转向自回归。但训练技术这方面,目前似乎还不清晰。”
💡 如果你能在理论上这个理想状态下,拥有极快的网络,理论上你就可以省掉 HBM 这一步,直接把 KV 缓存从一个节点传到另一个节点。
大规模推理服务中,KV 缓存的传输成为瓶颈。如果网络速度能接近 HBM,节点间的聚合推理服务将获得接近 100 倍的速度提升。这可能是推理工程下一个重大的突破方向。
“如果有人能解决这个问题,解码速度真的会快两个数量级。这就是我的看法。”
🌐 播客信息补充
本播客采用原有人声声线进行播客音频制作,也可能会有一些地方听起来怪怪的
使用 AI 进行翻译,因此可能会有一些地方不通顺;
如果有后续想要听中文版的其他外文播客,也欢迎联系微信:iEvenight
