我预判,RSI会是10月最火的概念。
最近硅谷最火的一个词,可能是 RSI——Recursive Self-Improvement,递归自我改进。最简单的理解是:让 AI 学会改进自己,并且让下一代 AI,比上一代更会“改进 AI”。
这听起来像一个离我们还很远的 AGI 命题,但资本已经先动了。
今年上半年,国内已经冒出了一批 RSI 创业团队。一些投资机构甚至在这个词进入大众视野之前,就已经把国内项目扫过了一轮。海外,OpenAI、Anthropic、Google、Meta 都已经在不同程度上让 AI 参与 AI 的研发;Sakana AI、Recursive 等新公司,也在试图把“AI 研究 AI”进一步推向自动化和自我进化。
所以这一期《非标玩家UnDefined》,我们找来了一位已经密集看过国内 RSI 项目的投资人沈筱。
嘉宾介绍:
沈筱:AKA沈雅岚,星连资本行研总监。星连资本大家都熟悉吧,最近刚投了RSI的超衍智能。沈老师曾在奇绩创坛、36氪工作,长期身处科技创业的一线,同时又有很强的研究习惯。这让她既能看到最新的创业和投资趋势,也习惯把一个新概念拆开、追溯和梳理清楚。【星连资本(LinkX Capital)创建于 2021 年,是中国最早聚焦通用智能产业生态、目前最活跃的 AI 风险投资基金之一。】
王与桐:我长期泡在 AI 创业和投资一线,最近发现聪明钱和前沿研究者的注意力开始往一个地方移动,所以我提前去把它问明白。我是嘴替。相信对RSI不熟、微熟,已熟但不了解海外趋势的人群,都会有价值。
我们首先花了很长时间给这个正在迅速膨胀的概念划边界。
AI 会总结失败、修改 Skill、积累 Memory,算 RSI 吗?AI for AI、RL、持续学习、AI Scientist、Auto Research,为什么现在都开始被放进 RSI 这个筐里?真正的 Recursive 到底发生在哪里?
然后我们把视角转向了正在真正做这件事的人。锐评OpenAI、Anthropic、Google、Meta怎么做RSI,硅谷正当红的日本公司Sakana等,沈老师解析中国有哪些做RSI的模型公司(智谱、Minimax、大厂)。
再往后,我们聊到了钱。
如果 OpenAI、Google 这些拥有最好模型、最多算力和最强研究员的大公司自己就在做,为什么 RSI 还会是创业公司的机会?
可能的答案是:今天的大模型公司最终仍然要服务于基础模型能力,而一家创业公司可以把全部资源押在 Auto Research、AI for Chip,或者某一个具体的自我进化闭环上。
但这里存在很残酷的前提:如果开源模型持续进步,这些公司可以站在基础模型之上继续往前;如果开源模型停止进步,它们最终还是要回到最艰难的基础研究。
这也意味着,RSI 未必会让 AI 从此摆脱算力竞争。
算力决定你能同时跑多少实验,Infra 决定一个想法多久能得到验证,而 Verifier 决定 AI 到底知不知道自己这一轮有没有真的变好。尤其当问题从数学、代码进入科研、创意乃至物理世界,一个越来越棘手的问题会出现:
如果连人类都很难定义什么叫“更好”,AI 要朝哪里进化?
节目的最后,我们还把这个问题延伸到了具身智能。
数字世界里的 AI 可以低成本地试错几千、几万次,但机器人每一次错误都会发生在真实世界。当“自我进化”从代码和模型走向一个真正有身体的机器人,RSI 还会以同样的方式发生吗?
过去几年,我们一直在讨论 Scaling Law:更多的数据、算力和参数,能不能生产出更强的智能。
而 RSI 提出了更激进的问题:
如果未来连“如何生产更强的智能”这件事本身,都开始交给 AI 呢?
那时候,被加速的可能不再只是编程、科研或者某一种工作。
被加速的,是 AI 的进步本身。
shownotes:
02:44|VC 的钱已经到了,大众为什么还没开始讨论 RSI?
04:25|到底什么才算 RSI?关键为什么是 Recursive?
07:44|AI 到底可以进化什么:Skill、Harness,还是 Model?
沈老师批注:1、这个skill本身也会在后续的使用过程中不断改进。
2、然后像这种组件其实还有很多。除了组件本身的定制化之外,另外一个层面就是 harness。
前段时间其实也有蛮多 work 在讲 meta-harness。也就是说,harness 本身、整个 harness framework 其实也是可以定制和优化的。比如说,它可以决定一些组件什么时候该变、应该怎么变。这个其实相当于是一个更高维度的优化。
但 harness 这一层,本质上不一定涉及模型参数本身的更新。就是说,我不会 necessarily 拿这些东西去更新 base model 的参数,而是更多停留在 agent execution 这一层,比如优化它的 planning、执行流程,或者组件之间的协作,让整个 agent 跑得更可靠,最终任务完成的效果更好。
3、比如说,如果你的进化目标很明确,而且验证又很简单,那这个事情其实就会比较容易做。
举个例子,一个 skill 这次执行失败了,AI 自己就可以去总结失败的原因。然后这个反馈可能会进入它的 memory,或者直接反过来修改这个 skill。这样下一次再执行同类任务的时候,这个 skill 可能就已经被调好了。
因为这里的反馈路径非常短,而且结果也很好验证:这个任务到底有没有执行成功,通常是一个非常显著的信号。所以它天然就形成了一个比较清晰的闭环。
但如果再往更高一层,比如说你要做 meta-harness 层面的优化,问题就会变得复杂很多。因为这时候你真正想衡量的是:整个 harness framework 本身带来的收益,是不是随着迭代在持续提高?
而到了这个层面,可能连一个足够明确的评价标准都还没有。也就是说,你不仅要解决“怎么优化”的问题,甚至首先要解决“到底怎么衡量它有没有变好”这个问题。
11:36|国内 RSI 创业公司都在从哪里切入?RL、AI for AI、AI Scientist 和 RSI 到底什么关系?
沈老师说的表:如何定义RSI
Good (1965), Speculations Concerning the First Ultraintelligent Machine
1965 年 I. J. Good 就有 intelligence explosion;Schmidhuber 很早就在做 self-referential learning 和 Gödel Machine
17:26|AI Scientist 已经走到哪一步?AI 会做实验以后,能不能自己提出真正有价值的新 Idea?
21:28|中美讨论的是同一个 RSI 吗?为什么这个几十年前就出现的概念,偏偏在 2026 年爆火?
24:59|中美 RSI 现在差多少?为什么算力可能再次拉开差距?
29:16|OpenAI:AI 已经开始给顶尖研究员“打工”,从 Research Intern 到 AI Researcher 还有多远?
沈老师批注:2026年9月,在一位博士后的指导下,两名高中生,借助AI工具,解决了菲尔兹奖得主许埈珥(June Huh)2022年获奖后一直未攻克的组合数学难题。
两名高中生是 Aayush Bathija 和 Prince Rohatgi,指导者是 UCLA 博士后 Daniel Soskin;论文题目是 “Bounded Ratios of Lorentzian Polynomials”,2026 年 9 月上传到 arXiv
参考链接:mp.weixin.qq.com
37:35|Anthropic、Google、Meta 都在怎么做?AlphaEvolve 为什么代表了另一条路线?
43:23|一个意外的话题:AI 越来越强以后,创始人的价值观会不会越来越重要?
47:13|国内大模型公司其实都在做,只是为什么没有像海外一样“打明牌”?
49:29|Sakana AI:为什么一家没法和美国拼算力的日本公司,反而成了 RSI 最值得关注的玩家之一?
提到的古德曼机,都是哥德尔机。
54:18|什么时候才算真正发生“递归”?AI 改进 AI 的效率,什么时候能够超过人类?
56:35|如果 OpenAI、Google 自己就在做,RSI 为什么还会是创业公司的机会?
1:00:12|一个残酷的前提:如果开源模型停止进步,这批 RSI 创业公司会发生什么?
1:01:01|为什么 Infra 可能决定 RSI 的“进化斜率”?研究能力之外,实验速度同样重要
1:03:18|RSI 会不会重新改写 AI 的游戏规则:从资本密集重新回到研究密集?
1:05:53|RSI 现在能商业化吗?AI Scientist 的第一批客户到底是谁?
1:08:55|RSI 最大的瓶颈是什么?为什么 Verifier 可能比“让 AI 变聪明”更难?
沈老师批注:这里还有一个非常关键的问题,就是“验证”。
现在大家讲 RLVR,也就是 Reinforcement Learning with Verifiable Rewards。它之所以在数学、代码这类领域有效,一个重要原因就是这些任务存在相对明确、可验证的奖励信号。比如一道数学题答案对不对、一段代码能不能通过测试,都可以比较客观地判断。于是模型可以基于这样的 reward signal 反复探索和学习,形成一个持续的自我改进闭环。
真正困难的是不可验证领域。
当一个任务没有天然的 ground truth 时,你怎么构造 rubric,怎么定义 reward function?什么叫“这一轮比上一轮更好”?甚至“好”本身可能都是模糊的、多维度的。这个时候,如果奖励目标定义得不准,模型优化得越充分,反而可能只是越来越擅长优化一个错误的 proxy。
所以验证真正重要的地方在于:AI 必须能够判断自己的改进是否真实发生。它需要知道这一轮是不是比上一轮更好,以及下一轮应该朝什么方向继续优化。
从这个角度看,AI 能不能持续 self-improve,很大程度上取决于一个领域能不能建立可靠的验证和反馈机制。数学、代码天然占优,而在科研、医疗、企业决策等更开放的场景里,如何把模糊的“好坏”转化成足够可靠的 reward signal,本身可能就是最核心的基础设施之一。
1:10:48|具身智能也开始讲 RSI:机器人在物理世界“越干越好”,和大模型的 RSI 是一回事吗?
1:13:17|为什么物理世界的 RSI 一定会比数字世界更慢?
概念介绍
RSI(Recursive Self-Improvement,递归自我改进)
AI 不仅能够自我改进,而且“改进自己的能力”本身也会被改进。最核心的判断是:下一代 AI 是否比上一代更擅长让 AI 变强。
Self-Improvement(自我改进)
AI 根据任务结果和反馈调整自己的行为、Skill、Memory,甚至模型能力。Self-Improvement 不一定等于 RSI,真正的 RSI 还需要发生“递归”。
AI for AI(AI4AI)
用 AI 参与 AI 的研发,包括写训练代码、生成数据、优化 Kernel、寻找新算法、辅助模型训练等。它的范围比 RSI 更大,也是今天 OpenAI 等前沿实验室已经大量实践的方向。
Automated AI Research / AI Scientist
让 AI 参与甚至逐渐完成一套完整的科研流程:提出假设、设计实验、写代码、运行实验、分析结果,再决定下一步研究方向。它被认为是走向 RSI 的重要路径之一。
Harness
模型之外,让 Agent 真正完成工作的整套运行环境,包括工具、Skill、Memory、执行框架等。RSI 不一定首先发生在模型参数上,Harness 本身同样可以不断自我改进。
Meta-Harness
比 Harness 自我优化再高一层:系统不仅修改某一个 Skill 或组件,还开始决定“哪些组件应该改变、什么时候改变,以及怎么改变”。
Verifier(验证器)
判断 AI 一次改进究竟有没有变好的机制。它可能是 RSI 最关键的瓶颈之一:如果 AI 无法判断这一轮究竟比上一轮好在哪里,也就不知道下一轮应该朝什么方向进化。
Verifiable Reward(可验证奖励)
在数学、代码等拥有相对明确正确答案的领域,可以通过客观结果判断 AI 有没有进步。这也是为什么这些领域更容易率先形成自我改进闭环。
AlphaEvolve
Google DeepMind 探索的一类演化式方法:让模型产生大量候选方案,再通过自动评估、筛选和迭代寻找更优算法。它代表了与“AI 科学家 Copilot”不完全相同的一条路线。
DGM(Darwin Gödel Machine)
Sakana AI 探索的自我改进系统。Agent 可以修改自身代码,通过编程任务验证修改效果,并保留有效的改进路径,是目前 RSI 讨论中经常被提及的代表性工作。
Infra / AI for Infrastructure
支撑 AI 研究和实验的底层基础设施。好的 Infra 可以让研究者更快写代码、跑实验、获得反馈,因此它影响的不只是单次实验效率,还可能影响整个 AI 研发的“进化斜率”。
In-Context Learning(上下文学习)
模型不更新参数,仅通过当前上下文中的示例和信息学会完成新任务。节目后半段讨论具身 RSI 时也提到:机器人“做一次就学会”,并不必然意味着已经发生了 RSI。
Embodied RSI / 物理世界的自我改进
把自我改进从数字世界延伸到机器人等物理智能体。相比代码和数学,物理世界的试错成本更高、反馈更复杂,因此真正形成递归式自我改进可能也会更慢。
非标玩家UnDefined是一档商业人物访谈播客,致力于让世界看到中国商业和科技力量,只影响1%的商业决策者。
欢迎有认知的商业决策者联系、合作~


