Moonshot 发布的 Kimi K3 技术报告:一个 2.8 万亿参数、1M 长上下文、原生多模态、完全开源权重的前沿 MoE 大模型。
摘要:
在类似规模的预训练基础上反复堆叠,开源进展有收敛风险,而与最强闭源系统之间的差距却在继续拉大。」「Kimi K3 试图在两条轴线上同时冲到前沿:把预训练基础扩展到前所未有的 3T 级参数规模,同时把强化学习、推理努力和 100 万上下文长程交互一并拉满。」
「我们训练了一个 2.8T 参数的原生多模态 MoE 模型,激活参数 104B,支持 100 万 Token 上下文,并通过架构、数据和训练配方的改进,相比 Kimi K2 实现了约 2.5× 的整体缩放效率提升。」
「Kimi K3 的后训练阶段被明确地设计为服务于 100 万上下文的测试时扩展:跨长程代码、通用 Agent、推理与知识任务做强化学习,并覆盖多个推理努力等级。」
「在长程代码、Agent、知识、推理与视觉任务的基准上,Kimi K3 在整体上仍落后于最强的闭源系统——Claude Fable 5 与 GPT-5.6 Sol——但在我们评估的其它开源与闭源模型中,它表现最为稳定且总体领先。」
「Kimi K3 结合了三大系统挑战:混合 KDA 注意力、3T 级稀疏多模态训练与推理、以及百万 Token 级的 Agent 工作负载——我们的基础设施在这三条战线上做了联合协同设计。」
来源:github.com

