模型能力持续演进,应用场景不断拓展,系统的规模与复杂度也随之提升。这些变化对底层基础设施提出了更高要求。
从训练阶段的计算与通信效率,到推理阶段的吞吐、延迟与成本优化,再到异构硬件适配、模型部署、资源调度和系统稳定性,每个环节都包含大量复杂的研究与工程问题。AI Infra 不仅决定模型能否被高效训练,也影响它能否以可控的成本,稳定地服务于真实场景。
这一期节目,我邀请到了三位来自 UC Berkeley Sky Lab 和 MIT Han Lab 的在读博士生,聊了聊他们近期的工作,以及在研究过程中形成的对 AI Infra 的理解。
他们分别是:
杨上:MIT Han Lab 三年级博士生,师从Song Han,近期TLT工作登MIT News封面,曾获MLSys 2024 Best Paper Award;
近期研究方向:Efficient ML、Inference/training system、Model Compression;
王一川:UC Berkeley Sky Lab 二年级博士生,师从Joseph E. Gonzalez & Matei Zaharia,主导项目LEANN获MLSys 2026 Best Paper Award;
近期研究方向:Agent infra/Serving infra/Post training infra;
杨硕:UC Berkeley 二年级博士生,师从Ion Stoica,StreamDiffusionV2工作获MLSys 2026 Best Paper Award;
近期研究方向:语言模型与视频生成推理系统、底层算子开发;
Host:梁瑶(「涌现Lab」创始人)
以下是对话时间线:
三位嘉宾的 MLSys 研究路径
TLT:用推测解码缓解 RL Rollout 的长尾瓶颈
Leann:探索个人设备上的高效 RAG
StreamDiffusionV2:流式视频生成的系统优化
当 Agent 开始优化 CUDA Kernel
Agent Infra:从模型推理走向环境与上下文管理
Agent 时代的 PD 分离与推理系统新趋势
从 A100 到 Blackwell:硬件迭代如何影响系统开发
从预训练到后训练:基础设施的不同侧重点
多模态推理中的 KV Cache 压缩与管理
如何发现重要问题:研究习惯与 Agent 时代的判断力
完整对话内容还请查看「涌现Lab」公众号,整理不易,欢迎一键三连!

