43. 大模型半年报:RSI,Fable,5.2,混元3,龙猫,到处都是斩杀线 - 王铁震苔藓之火

43. 大模型半年报:RSI,Fable,5.2,混元3,龙猫,到处都是斩杀线 - 王铁震

76分钟 ·
播放数1774
·
评论数14

“模型困在自己训练的语料里,他吃进去的语料实际上是他的枷锁。”
“RSI 就是——你先靠人类智慧堆出一个够聪明的模型,然后它自己从外界获取信息,自己迭代。”
“许愿式编程:你满足了当下的要求,但后果是拆东墙补西墙。”
“人类能抽象出牛顿第二定律,模型只能记住所有落地的轨迹——这是本质区别。”
“先扎马步,扎六个月,不要想九阴真经——这才是大智慧。”
“越有智慧的人越不屑于黑 NASA,但一个受过训练的 19 岁高中生可以——他们训练的也许是黑化的爱因斯坦。”

嘉宾:王铁震 |前Hugging Face APAC Ecosystem Head | Linkedin联络方式

完整无删节版本请看视频播客 ▶️YouTube链接

免责申明:本节目的所有内容都并非旨在提供任何形式的建议,包括但不限于投资、税收、会计或法律上的任何建议。

时间核心话题

00:0002:00Q2 的 AI 世界恍如隔世,GM5.2 已取代 OpenAI 4.8 成为主力工具;开源模型斩杀线持续上移。

02:0006:30RSI(递归自我改进) 与 auto research 的区别:前者是“编译自己”,让模型自己优化自己;后者是优化外部目标。RSI 更像循环闭环。

06:3010:00RSI 无法达到 100% 自主,人类参与比例虽递减但不可归零;代码生成行数虽多,但指令和架构仍由人类定义。

10:0014:00“许愿式编程”的陷阱:AI 满足当下需求,但拆东墙补西墙,项目复杂度超限后无法维护;新模型版本成了“救火队”。

14:0018:00人类的核心价值是抽象能力——将百万行代码提炼为不变量和模块;模型生成的是“始山”(spaghetti code),缺乏高屋建瓴的设计。

18:0022:00模型困在自己的训练语料里,语料即枷锁;它只能组合已有方法,无法真正开拓全新领域,真正的创新仍依赖人类的“research taste”。

22:0026:00数据飞轮:交互数据(录屏、操作反馈)是模型进化的燃料;未来产品两大方向——高效收集人类智能数据 + 将智能无处不在地下发。

26:0030:00Harness(工具链) 从 TUI 起步,用户体验决定胜负;不会一家垄断,类似前端框架 React 等生态共存。

30:0034:00Fable的发布:marketing 成分大于范式突破;它并未改变底层逻辑,而是通过训练“恶意语料”制造能力差,本质是“黑化的爱因斯坦”。

34:0038:00安全悖论:要防黑化,先学黑化;Anthropic 收集大量攻击性语料,但智能本身不等于不安全,越有智慧反而越可能克制。

38:0042:00中美差距:马斯克判断中国 2027 Q1 赶上 vivo,唐杰认为更快;中国模型迭代速度已追上来,超越只是时间问题。

42:0046:00开源模型的进步是所有人的进步;投资角度上,赛道虽拥挤,但开源让模型透明化,倒逼真正科研投入。

46:0050:00美团龙猫:在纯国产卡集群上成功训练 1.6T 模型,工程突破巨大,说明中国厂商已能绕过 N 卡限制。

50:0054:00腾讯混元三:不追新架构,扎马步式打磨数据和训练方法,性能飞跃;证明数据清洗和质量比结构创新更关键。

54:00 – 结束“Coding”是个有毒的词,本质是 Automation(自动化)——所有数字世界的工作都可被自动化

本期提到

模型

  • GLM-5.2(智谱) — 王铁震口中 Q2 最受震撼的发布,已在他的实战工作流里取代 Opus 4.8——不如 Fable 聪明,但能一口气把长程任务做完。

  • Opus 4.8(Anthropic) — 被他形容成会顶嘴的资深员工:任务给过去先跟你讨价还价、要求改 scope。

  • Fable(Anthropic) — 本期的核心争议对象。主打 0day 漏洞挖掘和国家安全叙事,王铁震认为能力强但范式没有跃迁,发布更像是被开源斩杀线逼出来的。

  • Kimi 2.5 / 2.6 — 他拿来复现 Fable 宣称的漏洞:给了 hint、把问题局部化之后同样能找到,差在海量遍历时能不能自己 spot 到。

  • 混元 3(腾讯) — 本期最长的一段技术讨论。结构相比 preview 版几乎没变,只换了数据和训练方法就有巨大性能飞跃,被当作「数据 > 结构」的证据。

  • LongCat 2.0(美团) — 1.6T 模型,在完全没有 N 卡的五万卡国产集群上训出来,王铁震认为工程上是非常大的突破。

  • 百灵(蚂蚁) — 对照组:此前尝试在 N 卡与国产卡混合的集群上训练,LongCat 则是全国产。

  • MiniMax — 传闻要做 2-3T 的开源大模型,被用来讨论「尺寸上去之后开源模型能否直接找到漏洞」。

  • DeepSeek — 作为「斩杀线」这个概念最早的锚点被提起——如今线已经被推得更前。

公司

  • Anthropic — 今天 ARR 第一、Q2 断层领先,但两位主播都认为它的溢价正在被开源和中国模型压缩。

  • 智谱 / 唐杰 — GLM-5.2 的作者。唐杰回应马斯克「不用等到 2027 年」,隔天股价大涨。

  • OpenAI / Sam Altman — Codex 并入 ChatGPT、推出 Record Replay;节目末尾被拿来做脑洞:如果有机会,他会不会买 Cursor。

  • xAI / 马斯克 — 马斯克在推特上判断中国模型 2027 Q1 追上,并主张「有用的智能唯一衡量标准是收入」;xAI 收购 Cursor 被解读为买数据。

  • Cursor — 在 Anthropic 已有 Claude Code、自己也推出了 Composer 的情况下仍被收购,说明这笔交易看的是人工编程数据。

  • 腾讯 / 姚顺宇 / CodeBuddy — 组织架构上给了足够空间;姚顺宇不追奇技淫巧、专注扎马步式的数据清洗;CodeBuddy 内外部使用量都为模型带来数据。

  • 美团 — 外卖大战打得焦头烂额,还抽空做出了 LongCat,被当作「非模型厂商也在推高斩杀线」的代表。

  • Recursive — RSI 概念的旗手公司,Q2 完成大额融资,田渊栋以 co-founder 身份加入。

  • 苹果 — 被看好走「智能的盒子」路线:买一次设备、模型跑在本地,卖的是隐私和不被断供。

  • Meta / 小米 / Airbnb — Meta 被认为随时能翻盘回桌;小米和美团一样属于非模型厂商入场;Airbnb 则是拿开源 check point 自己微调的典型。

产品

  • Claude Code — Harness 的标杆,也是「日更」的原因:难的从来不是做出来,而是极致的用户体验和安全兜底。

  • Codex — 与 Claude Code 的对照——没有危险命令检测的小模型,但有 Sandbox,两条不同的解题路线。

  • Record Replay(OpenAI) — 录屏学你怎么改简历、怎么筛简历,然后替你重复——Raymond 认为这正是上一期说的「劳动数据」的产品化。

  • OpenCode / Cline — 证明 Harness 不会被垄断,但会像 Vue 和 React 一样收敛到少数几家做得更好的。

  • vLLM / SGLang — 他 RSI 实验里「还没被自己掌控」的一环:下一步是让 GLM-5.2 自己写出自己的推理。

概念

  • RSI(递归自我改进) — 本期主线。和 auto research 的区别在于:auto research 是用一个东西优化另一个东西,RSI 是把这个环接到自己身上。

  • 自举 / compiler bootstrapping — 解释 RSI 用的比喻:C 语言编译器最终用 C 自己来编译自己,模型也该走到自己迭代自己。

  • 100% RSI 不可能 — 他的判断:完全闭环会熵增,屎山越滚越大直到超出模型能力;必须持续从外界摄取低熵的人类 input。

  • 许愿式编程 — 对结果有期盼、对过程和可复现性没有期待——像刮彩票,刮到十个亿很好,但线上出事故时你刮不出来。

  • 一口气能做对的项目 size — 他给出的一个衡量模型能力的实用指标:两万行的原型现在能一次跑对,往上加就开始六亲不认。

  • 白盒 / 黑盒 — 软件工程正在从人写代码的白盒,变成人定架构、机器写实现的灰盒甚至黑盒。

  • research taste — 在他和 Recursive 的逻辑里都是瓶颈:现存语料会给你 137 种「这事做不成」的理由,敢不敢做网状回收火箭是人的事。

  • 蒸馏与智能的网络效应 — 你从最新模型里拿到的智能,其实来自地球另一端某个人趟出来的新路径——模型厂商只是把它蒸馏了进去。

  • 古法手作 — 他对上一条的回应:人得留一点自己动手的能力,否则会被锁死在模型的平均值里。

  • predict the next token 的枷锁 — 模型能把 A 领域的方法搬到 B 领域,但开创一个全新的 C 领域不是它的训练目标——在语料看来那就是幻觉。

  • 黑化的爱因斯坦 — 解释 Fable 的攻击能力:智能本身不等于不安全,是海量攻击语料训出了一个会黑 NASA 的爱因斯坦。

  • 斩杀线 — 开源和非模型厂商不断把这条线往前推,闭源模型必须拉开一个身位才卖得动。

  • 大马造小鞍 — 他 RSI 实验的路径:用 Claude Code + Fable(大马大鞍)带 GLM-5.2 造出自己的 Harness,再做推理、再做 LoRA 训练,链路就闭合了。

  • coding 其实是 automation — Raymond 的非共识:code 这个词有毒、太 technical,它真正说的是「所有数字化的工作都能被自动化」。

  • 数据孤岛 — 点评答不了「这个商场哪家咖啡店没人」,因为中国各家 APP 数据不打通——这也是每家大厂都要自己做模型的原因之一。

文章

  • Anthropic 的 RSI 文章 — Claude Code 里 80% 的代码已由 Claude 写;文章担忧的是 recursive drift——孩子长大后开始和你不 align,而你已经管不住了,因此呼吁各国联合监管。

  • 《晚点》关于混元 3 的独家深度报道 — 节目里明确说会放进 show notes。两个要点:腾讯在组织架构上给了足够空间,以及姚顺宇不追奇技淫巧、把力气全花在数据清洗上。

💡 核心观点

  • 训练语料是模型的枷锁:它学习的是人类已知的“平均”,无法跳出这个边界;而人类以极慢的速度探索未知,这正是原生价值。

  • 未来竞争不在模型结构,而在数据和用户体验:混元三靠数据清洗逆袭,美团靠工程落地,开源让智能商品化,但差异化在于“使用智能的脚手架”。

  • 安全与恶的悖论:Dario 通过“先黑化”来防黑,但本质是收集了所有恶意手段,这本身就是一个巨大的伦理和治理挑战。

  • Coding 即许愿:未来的编程不是写代码,而是用自然语言描述意图,模型自动实现——这是自动化,不是代码行数。

展开Show Notes
阿白er
阿白er
1 天前
哈哈录早了
0xRaymond
:
真的是没有办法,每一天都有新模型出来,以后改直播哈哈哈
阿白er:期待
更达
更达
1 天前
说的太真实了,一点点失去对项目的失控
太太家的野男人:开好多个窗口,自己没想好架构,一直approve…… 项目失控,开始心虚许愿,……,删了重新搞吧……
0xRaymond
:
不要再说了…… 都是来时路
鲜世丹
鲜世丹
19小时前
35:22 感觉嘉宾更愿意聊一些国内开源模型或产品,主播可以放开一点,不用局限在 anthropic 和 OpenAI 这两家
0xRaymond
:
我没有啊,龙猫混云都聊了,只是当时没有K3
HD690480y
HD690480y
19小时前
听不清楚,吞音太多
0xRaymond
:
我是用Claude剪的,模型听不见,感觉还是有很多问题,我下次争取更好
亢老师
亢老师
1 小时前
34:23 我们在做这种,老师需要可以私我
HD890592s
HD890592s
1 天前
支持铁震老师
Soong_2zha
Soong_2zha
1 天前
有个本质上的问题,研发投资都有经验吧?资本大佬上面也有股东哈,为啥开源模型用的钱少而且人才不行,为啥可以打巨资研发出来的闭源模型?难道资方都是傻子么!难道我们还是在人有多大胆地有多大产的时期么?
Fangliangyu
Fangliangyu
1 天前
Shownote里面的时间线不对😂