[Devansh] Kimi K3:开权重模型如何把 Claude Fable 级智能做便宜

[Devansh] Kimi K3:开权重模型如何把 Claude Fable 级智能做便宜

22分钟 ·
播放数3
·
评论数0

🧠 当模型不再试图记住一切,智能才开始像生命一样运作。

这一期,我们借 Devansh 的文章《Kimi K3: How an Open Weights Model Made Claude Fable Level Intelligence Cheap》,走进 Moonshot AI 的 Kimi K3:2.8 万亿参数、896 个专家、百万上下文背后,真正发生的不是一次“更大”的胜利。

它在学习选择:什么值得留下,什么值得回看,什么能力应被唤醒,以及一项工作何时不该放弃。

从 KDA 对记忆的审慎写入,到 AttnRes 对深层信息的回收;从 Stable LatentMoE 对 GPU 通信成本的克制,到在终端、浏览器、代码库与 Slack、Notion 式环境中反复试错的强化学习——Kimi K3 试图把 Transformer 从均匀燃烧的机器,变成一套会调度注意力、能力与时间的系统。

它逼近 Claude Fable 5 的,不只是答题能力,而是“把事做完”的耐力。代价也同样真实:更长的推理、更高的 token 消耗,以及一次行动可能走得太远。

未来的竞争,或许不再是谁拥有更多参数,而是谁拥有更好的选择器、更可靠的判断,以及更持久的状态。

原文链接:www.artificialintelligencemadesimple.com

发布时间:2026-08-28