本期内容来自主播近期综合各种学界业界观点,做的"模型自我进化"(RSI,递归自改进)的综述。同类的概念还包括 AutoResearch(自动研究)、AI for AI、持续学习等。模型自我进化并非凭空出现的黑科技,而是过去几年大模型几项底层能力默默叠加到一定程度后,自然而然产生的必然结果。
第一部分我们将梳理支撑大模型演进的四个基础底座:一是预训练与模型架构——通过超大参数与稀疏 MoE(每次推理只激活 3%–5% 的参数,如同万人大校只叫最对口的几十位教授)、混合注意力机制、以及 Muon 优化器等底层工程优化,让模型"又大又省";二是后训练与强化学习——通过合成数据、搭建真实沙盒环境、设定考核基准,教会模型长步骤执行与熟练使用工具;三是推理 Infra——用自研推理引擎、投机解码、量化与 GPU 算子优化,把推理成本和速度压到极致;四是 Harness——系统提示词、技能库、长期记忆、子 Agent 协同等软件脚手架,并开始与模型训练深度配合。
第二部分介绍在这四个底座上长出的核心概念:AutoResearch 已真实落地(Recursive 团队靠 AI 自动优化 GPU 算子击败专业团队夺冠,Kimi K3 也在用早期版本优化自身);RSI 是模型自己研究自己、修改自己,形成螺旋上升的闭环,与"蒸馏"有本质区别;AI for AI 则主张先有元模型、理解模型再谈提升。而 Ilya 创办的 SSI 正在探索的 TTT(测试时训练)新范式——让模型在推理过程中实时修改自身参数,可能彻底颠覆现有静态权重的大模型范式。
