Kimi K3为何能领跑开源大模型 | 杨植麟 | 月之暗面 | Muon优化器 | 长上下文

Kimi K3为何能领跑开源大模型 | 杨植麟 | 月之暗面 | Muon优化器 | 长上下文

22分钟 ·
播放数399
·
评论数0

本期深度回溯月之暗面创始人杨植麟在英伟达GTC大会上的技术演讲,完整拆解Kimi K3背后的三大技术扩展路径:通过Muon优化器配合QK clip将token效率提升两倍、Kimi Linear架构实现长短上下文全面超越全注意力、智能体蜂群范式通过三项奖励机制实现多智能体协同。还详解了K2.5首次实现视觉文本原生早期融合,发现模态互相增强的反常识结论,以及下一代注意力残差架构将token效率再提升24%的技术预告,最后探讨大模型时代"扩展阶梯"带来的研究方法论变革。

youtu.be

原视频来自:youtu.be

聊天讨论群,可加微信gxjdian入群,需备注,来自播客AI前沿