每一个微秒都重要 | 英伟达联合ETH论文 | AllReduce | NCCL | GB200

每一个微秒都重要 | 英伟达联合ETH论文 | AllReduce | NCCL | GB200

17分钟 ·
播放数185
·
评论数0

英伟达联合苏黎世联邦理工发布最新论文,将多GPU小消息AllReduce延迟从11微秒压至2.37微秒,距离硬件物理极限仅差7%。详解全局内存屏障的性能开销、四种无屏障同步机制(LL原子、哨兵、双缓冲、LL128原子)、ncclLLBuffer统一API设计,以及在vLLM推理中实现7%-13%延迟降低、每百万token节省超11美元的实测效果。当算力不再是唯一瓶颈,每一微秒的优化都在转化为真金白银的成本优势。

arxiv.org

原视频来自:youtu.be

聊天讨论群,可加微信gxjdian入群,需备注,来自播客AI前沿