
“模型困在自己训练的语料里,他吃进去的语料实际上是他的枷锁。”
“RSI 就是——你先靠人类智慧堆出一个够聪明的模型,然后它自己从外界获取信息,自己迭代。”
“许愿式编程:你满足了当下的要求,但后果是拆东墙补西墙。”
“人类能抽象出牛顿第二定律,模型只能记住所有落地的轨迹——这是本质区别。”
“先扎马步,扎六个月,不要想九阴真经——这才是大智慧。”
“越有智慧的人越不屑于黑 NASA,但一个受过训练的 19 岁高中生可以——他们训练的也许是黑化的爱因斯坦。”
嘉宾:王铁震 |前Hugging Face APAC Ecosystem Head | Linkedin联络方式
完整无删节版本请看视频播客 ▶️YouTube链接
免责申明:本节目的所有内容都并非旨在提供任何形式的建议,包括但不限于投资、税收、会计或法律上的任何建议。
时间核心话题
– Q2 的 AI 世界恍如隔世,GM5.2 已取代 OpenAI 4.8 成为主力工具;开源模型斩杀线持续上移。
– RSI(递归自我改进) 与 auto research 的区别:前者是“编译自己”,让模型自己优化自己;后者是优化外部目标。RSI 更像循环闭环。
– RSI 无法达到 100% 自主,人类参与比例虽递减但不可归零;代码生成行数虽多,但指令和架构仍由人类定义。
– “许愿式编程”的陷阱:AI 满足当下需求,但拆东墙补西墙,项目复杂度超限后无法维护;新模型版本成了“救火队”。
– 人类的核心价值是抽象能力——将百万行代码提炼为不变量和模块;模型生成的是“始山”(spaghetti code),缺乏高屋建瓴的设计。
– 模型困在自己的训练语料里,语料即枷锁;它只能组合已有方法,无法真正开拓全新领域,真正的创新仍依赖人类的“research taste”。
– 数据飞轮:交互数据(录屏、操作反馈)是模型进化的燃料;未来产品两大方向——高效收集人类智能数据 + 将智能无处不在地下发。
– Harness(工具链) 从 TUI 起步,用户体验决定胜负;不会一家垄断,类似前端框架 React 等生态共存。
– Fable的发布:marketing 成分大于范式突破;它并未改变底层逻辑,而是通过训练“恶意语料”制造能力差,本质是“黑化的爱因斯坦”。
– 安全悖论:要防黑化,先学黑化;Anthropic 收集大量攻击性语料,但智能本身不等于不安全,越有智慧反而越可能克制。
– 中美差距:马斯克判断中国 2027 Q1 赶上 vivo,唐杰认为更快;中国模型迭代速度已追上来,超越只是时间问题。
– 开源模型的进步是所有人的进步;投资角度上,赛道虽拥挤,但开源让模型透明化,倒逼真正科研投入。
– 美团龙猫:在纯国产卡集群上成功训练 1.6T 模型,工程突破巨大,说明中国厂商已能绕过 N 卡限制。
– 腾讯混元三:不追新架构,扎马步式打磨数据和训练方法,性能飞跃;证明数据清洗和质量比结构创新更关键。
– 结束“Coding”是个有毒的词,本质是 Automation(自动化)——所有数字世界的工作都可被自动化
本期提到
模型
GLM-5.2(智谱) — 王铁震口中 Q2 最受震撼的发布,已在他的实战工作流里取代 Opus 4.8——不如 Fable 聪明,但能一口气把长程任务做完。
Opus 4.8(Anthropic) — 被他形容成会顶嘴的资深员工:任务给过去先跟你讨价还价、要求改 scope。
Fable(Anthropic) — 本期的核心争议对象。主打 0day 漏洞挖掘和国家安全叙事,王铁震认为能力强但范式没有跃迁,发布更像是被开源斩杀线逼出来的。
Kimi 2.5 / 2.6 — 他拿来复现 Fable 宣称的漏洞:给了 hint、把问题局部化之后同样能找到,差在海量遍历时能不能自己 spot 到。
混元 3(腾讯) — 本期最长的一段技术讨论。结构相比 preview 版几乎没变,只换了数据和训练方法就有巨大性能飞跃,被当作「数据 > 结构」的证据。
LongCat 2.0(美团) — 1.6T 模型,在完全没有 N 卡的五万卡国产集群上训出来,王铁震认为工程上是非常大的突破。
百灵(蚂蚁) — 对照组:此前尝试在 N 卡与国产卡混合的集群上训练,LongCat 则是全国产。
MiniMax — 传闻要做 2-3T 的开源大模型,被用来讨论「尺寸上去之后开源模型能否直接找到漏洞」。
DeepSeek — 作为「斩杀线」这个概念最早的锚点被提起——如今线已经被推得更前。
公司
Anthropic — 今天 ARR 第一、Q2 断层领先,但两位主播都认为它的溢价正在被开源和中国模型压缩。
智谱 / 唐杰 — GLM-5.2 的作者。唐杰回应马斯克「不用等到 2027 年」,隔天股价大涨。
OpenAI / Sam Altman — Codex 并入 ChatGPT、推出 Record Replay;节目末尾被拿来做脑洞:如果有机会,他会不会买 Cursor。
xAI / 马斯克 — 马斯克在推特上判断中国模型 2027 Q1 追上,并主张「有用的智能唯一衡量标准是收入」;xAI 收购 Cursor 被解读为买数据。
Cursor — 在 Anthropic 已有 Claude Code、自己也推出了 Composer 的情况下仍被收购,说明这笔交易看的是人工编程数据。
腾讯 / 姚顺宇 / CodeBuddy — 组织架构上给了足够空间;姚顺宇不追奇技淫巧、专注扎马步式的数据清洗;CodeBuddy 内外部使用量都为模型带来数据。
美团 — 外卖大战打得焦头烂额,还抽空做出了 LongCat,被当作「非模型厂商也在推高斩杀线」的代表。
Recursive — RSI 概念的旗手公司,Q2 完成大额融资,田渊栋以 co-founder 身份加入。
苹果 — 被看好走「智能的盒子」路线:买一次设备、模型跑在本地,卖的是隐私和不被断供。
Meta / 小米 / Airbnb — Meta 被认为随时能翻盘回桌;小米和美团一样属于非模型厂商入场;Airbnb 则是拿开源 check point 自己微调的典型。
产品
Claude Code — Harness 的标杆,也是「日更」的原因:难的从来不是做出来,而是极致的用户体验和安全兜底。
Codex — 与 Claude Code 的对照——没有危险命令检测的小模型,但有 Sandbox,两条不同的解题路线。
Record Replay(OpenAI) — 录屏学你怎么改简历、怎么筛简历,然后替你重复——Raymond 认为这正是上一期说的「劳动数据」的产品化。
OpenCode / Cline — 证明 Harness 不会被垄断,但会像 Vue 和 React 一样收敛到少数几家做得更好的。
vLLM / SGLang — 他 RSI 实验里「还没被自己掌控」的一环:下一步是让 GLM-5.2 自己写出自己的推理。
概念
RSI(递归自我改进) — 本期主线。和 auto research 的区别在于:auto research 是用一个东西优化另一个东西,RSI 是把这个环接到自己身上。
自举 / compiler bootstrapping — 解释 RSI 用的比喻:C 语言编译器最终用 C 自己来编译自己,模型也该走到自己迭代自己。
100% RSI 不可能 — 他的判断:完全闭环会熵增,屎山越滚越大直到超出模型能力;必须持续从外界摄取低熵的人类 input。
许愿式编程 — 对结果有期盼、对过程和可复现性没有期待——像刮彩票,刮到十个亿很好,但线上出事故时你刮不出来。
一口气能做对的项目 size — 他给出的一个衡量模型能力的实用指标:两万行的原型现在能一次跑对,往上加就开始六亲不认。
白盒 / 黑盒 — 软件工程正在从人写代码的白盒,变成人定架构、机器写实现的灰盒甚至黑盒。
research taste — 在他和 Recursive 的逻辑里都是瓶颈:现存语料会给你 137 种「这事做不成」的理由,敢不敢做网状回收火箭是人的事。
蒸馏与智能的网络效应 — 你从最新模型里拿到的智能,其实来自地球另一端某个人趟出来的新路径——模型厂商只是把它蒸馏了进去。
古法手作 — 他对上一条的回应:人得留一点自己动手的能力,否则会被锁死在模型的平均值里。
predict the next token 的枷锁 — 模型能把 A 领域的方法搬到 B 领域,但开创一个全新的 C 领域不是它的训练目标——在语料看来那就是幻觉。
黑化的爱因斯坦 — 解释 Fable 的攻击能力:智能本身不等于不安全,是海量攻击语料训出了一个会黑 NASA 的爱因斯坦。
斩杀线 — 开源和非模型厂商不断把这条线往前推,闭源模型必须拉开一个身位才卖得动。
大马造小鞍 — 他 RSI 实验的路径:用 Claude Code + Fable(大马大鞍)带 GLM-5.2 造出自己的 Harness,再做推理、再做 LoRA 训练,链路就闭合了。
coding 其实是 automation — Raymond 的非共识:code 这个词有毒、太 technical,它真正说的是「所有数字化的工作都能被自动化」。
数据孤岛 — 点评答不了「这个商场哪家咖啡店没人」,因为中国各家 APP 数据不打通——这也是每家大厂都要自己做模型的原因之一。
文章
Anthropic 的 RSI 文章 — Claude Code 里 80% 的代码已由 Claude 写;文章担忧的是 recursive drift——孩子长大后开始和你不 align,而你已经管不住了,因此呼吁各国联合监管。
《晚点》关于混元 3 的独家深度报道 — 节目里明确说会放进 show notes。两个要点:腾讯在组织架构上给了足够空间,以及姚顺宇不追奇技淫巧、把力气全花在数据清洗上。
💡 核心观点
训练语料是模型的枷锁:它学习的是人类已知的“平均”,无法跳出这个边界;而人类以极慢的速度探索未知,这正是原生价值。
未来竞争不在模型结构,而在数据和用户体验:混元三靠数据清洗逆袭,美团靠工程落地,开源让智能商品化,但差异化在于“使用智能的脚手架”。
安全与恶的悖论:Dario 通过“先黑化”来防黑,但本质是收集了所有恶意手段,这本身就是一个巨大的伦理和治理挑战。
Coding 即许愿:未来的编程不是写代码,而是用自然语言描述意图,模型自动实现——这是自动化,不是代码行数。

