

宇树王兴兴在 2026 WRC(世界机器人大会)上的发言2026 年 8 月 20 日,在宇树科技正式登陆科创板次日,创始人王兴兴于世界机器人大会(WRC 2026)主论坛发表主旨演讲,系统阐述了宇树在本体突破、AI 动作实时化、通用泛化瓶颈以及“物理 AI 自进化”层面的最新思考与布局。 十年演进与文化出圈:宇树2016年成立,从服务机器人转向人形机器人,2024年推出的基座机器人已成全球标杆。融合中国功夫的"武bot"海外播放数百亿次,天坛49台机器人表演尽显科技与传统文化交融;5月发布全球首款量产载人机甲,近期预览的人形机器人奔跑达12.65米/秒,超越人类极限。 落地探索:公司持续推动机器人进工厂,但受制于效率与泛化能力,尚未大规模推广。王兴兴强调AI与高质量数据成正比,真人数据与真实物理数据缺一不可,并重仓投入世界模型方向。 核心瓶颈"两个80%":机器人走进家庭的关键在于泛化能力——固定场景训练成功率可近100%,环境稍变即骤降。他提出产业爆发点:机器人进入80%的陌生场景、凭语言指令完成80%任务,快则2-3年、慢则5-10年到来。根本症结是AI模型输入输出与真实世界存在"毫米级"误差,无法闭环修正。 破局:物理AI自进化:宇树正推动机器人自进化——由顶尖大模型自主检索论文、生成控制代码,经仿真与真机验证、AI与人工打分反馈,形成正向循环,实现数据规模化与技能累加,开启物理AI进化的新纪元。
参数不是唯一旋钮:智谱唐杰谈 GLM-5.3 与Scaling Law的演进随着 GLM-5.3 的发布,业界在惊艳于其代码能力大幅跃升的同时,也好奇智谱为何没有跟其他前沿模型一样扩大基模参数量,而是依然沿用了总参数 753B、激活 40B 的模型框架进行后训练扩展。对此,创始人唐杰今天在 X 上发布长文,系统阐述了对 Scaling Law 的最新理解——大模型的演进,早已不是单纯堆叠参数的数字游戏。 唐杰回顾了Scaling Law的四次关键演进:从早期 Kaplan 指南盲目追求万亿参数的算力错配,到 Chinchilla 定律确立参数与数据的平衡,再到海量调用背景下因推理成本倒逼出的“过度训练”。更关键的是,进入 MoE 时代后,“知识”与“推理”发生了解耦——总参数仅代表模型承载事实知识的容量,而激活深度与长程因果推演能力,必须依赖后训练与有效计算深度的Scaling。 这次GLM5.3 的“受控实验”证明,模型能力的提升并非只能靠全盘重训,Scaling Law 存在多个独立的调控维度。盲目堆大参数往往不是最优解,在余量最大的旋钮(如后训练与 RL)上集中突破,才是当下性价比最高、也最具启发性的进化路径。 原文:https://x.com/jietang/status/2089941544581403107
RSI、AI for AI、AutoResearch 这些概念都在说什么本期内容来自主播近期综合各种学界业界观点,做的"模型自我进化"(RSI,递归自改进)的综述。同类的概念还包括 AutoResearch(自动研究)、AI for AI、持续学习等。模型自我进化并非凭空出现的黑科技,而是过去几年大模型几项底层能力默默叠加到一定程度后,自然而然产生的必然结果。 第一部分我们将梳理支撑大模型演进的四个基础底座:一是预训练与模型架构——通过超大参数与稀疏 MoE(每次推理只激活 3%–5% 的参数,如同万人大校只叫最对口的几十位教授)、混合注意力机制、以及 Muon 优化器等底层工程优化,让模型"又大又省";二是后训练与强化学习——通过合成数据、搭建真实沙盒环境、设定考核基准,教会模型长步骤执行与熟练使用工具;三是推理 Infra——用自研推理引擎、投机解码、量化与 GPU 算子优化,把推理成本和速度压到极致;四是 Harness——系统提示词、技能库、长期记忆、子 Agent 协同等软件脚手架,并开始与模型训练深度配合。 第二部分介绍在这四个底座上长出的核心概念:AutoResearch 已真实落地(Recursive 团队靠 AI 自动优化 GPU 算子击败专业团队夺冠,Kimi K3 也在用早期版本优化自身);RSI 是模型自己研究自己、修改自己,形成螺旋上升的闭环,与"蒸馏"有本质区别;AI for AI 则主张先有元模型、理解模型再谈提升。而 Ilya 创办的 SSI 正在探索的 TTT(测试时训练)新范式——让模型在推理过程中实时修改自身参数,可能彻底颠覆现有静态权重的大模型范式。
红杉「Own Your Intelligence」专题 6:持续学习-AI 智能体如何越用越好红杉资本近期发起「Own Your Intelligence」系列专题,邀请在"企业自建智能"议题上走得最远的几家公司做系统分享。本期由 Trajectory 联合创始人 Arjun Karanam 主讲,也是该系列活动的压轴演讲。他提出了"经验差距(Experience Gap)"的概念——模型的 IQ 在快速提升,但每次对话都像是第一天上班;而持续学习的核心,就是把那些被丢弃的智能体交互 token 转化为让智能体越用越好的信号。他围绕可追踪性(Traceability)、评测(Evals)、Harness、模型四个方面许下四个愿望,并介绍了 Trajectory 的产品愿景。 问题在于,今天的智能体在生产环境中生成了海量交互,绝大多数被直接丢弃。持续学习的本质,就是把用户意图、修正、撤销这些交互转化为训练信号。为此他给出四个愿望。 一是全链路可追踪,不只记录顶层动作,还要捕获包含子智能体和工具调用的完整调用树,尤其要抓住用户的纠错行为,编辑、撤销、重试远比点赞点踩更有价值。 二是评测贴近生产,每个任务都要可重放,直接在生产级 Harness 上跑评测。 三是赋能型 Harness,不要用"防呆"思维限制模型,而是提供清晰的基础原语,让工具返回丰富的信息,而不是简单的 Done 或 Success。 四是拥抱开放权重与模型路由,这是拥有权重和持续迭代的前提。 隐私问题上他的立场很明确:不直接拿客户私有数据训练,而是对客户数据分布采样、合成等价数据再更新模型。知识也分三层:通用技能训练进权重,组织级偏好存进情景记忆,个人习惯留在上下文里,各归其位,互不污染。 视频链接:https://www.youtube.com/watch?v=eYrMF9Cht8A&t=1s
红杉「Own Your Intelligence」专题 5:LangChain CEO-何时自研 Harness红杉资本近期发起「Own Your Intelligence」系列专题,邀请在"企业自建智能"议题上走得最远的几家公司做系统分享。本期由 LangChain 联合创始人兼 CEO Harrison Chase 主讲,聚焦什么时候该自建 Harness,什么时候该放心交给现成框架。 Harrison Chase 开篇先给智能体拆了骨架:一个完整的智能体由 Harness(编排层)、Model(模型)和 Context(上下文)三部分组成。所谓"拥有你的智能",意味着这三部分都要掌握在自己手里。其中 Harness 的本质极其简单,就是一个循环:模型接收请求、生成输出、调用工具、观察结果、继续下一步。真正需要定制的地方不在循环本身,而在循环的各个阶段插入中间件,比如模型调用前检查上下文长度并自动摘要,工具调用时拦截大型输入做上下文卸载,或者按需派发并行子智能体。 什么时候自建,什么时候直接用现成的?Harrison 给了一个清晰的判断框架:看任务落在模型的分布内还是分布外。通用编码、文件编辑这类与模型训练数据高度一致的任务,Claude Code、Codex 这类现成 Harness 已经做到最好,没必要重造轮子;而法律、金融这类偏离模型能力分布的业务任务,必须自建编排层。即使整体业务在分布外,其中局部动作可能仍在分布内,LangChain 的解法是引入 Model Profiles,根据所选模型动态切换最契合其训练分布的工具实现。 他强调评测与可观测性。智能体出错往往不是模型能力不够,而是进入上下文窗口的信息不对,因此必须能看到完整轨迹。数据飞轮的闭环是:运行智能体、收集轨迹、整理反馈、实验修复,甚至可以让后台 Coding Agent 自动分析生产轨迹并提交修复 PR。这让他引用 Satya 的观点有了落点:私有评测定义了组织内部"好"的标准,拥有记忆与轨迹,AI 投资才能复利增值。 视频链接:https://www.youtube.com/watch?v=HI2q3ci3Iuc&list=PLaqC3GACblSs&index=2
DeepSeek Harness 背后论文:万物皆插件,万物可重组这篇来自 DeepSeek 与北京大学的论文名为《一套处理时空可组合性的编程范式》,讲的是:让 AI 智能体像飞机边飞边换零件一样,在运行中给自己改代码、换组件,而不必停机重启。 要实现这个目标,得先解决"动态组合"难题。传统软件拼装完成后就无法改动,而未来的智能体需要随时加载、卸载组件,还不能留下垃圾。论文把问题拆成两半:一是"时间可组合性"——组件卸载时,它对系统的所有修改必须能完整撤销;二是"空间可组合性"——组件之间要正式声明依赖关系,由系统自动协调先后。作者拿 VSCode 举例:热门插件大多无法单独卸载,换个插件要重启整个程序,就像为了拔一根刺得把整只手砍掉重长。 论文给出了两套机制: 可逆效应,每次修改环境都记一笔"怎么还原",卸载时像剥洋葱一样逐层撤销; 反应式余效应,组件声明自己需要什么,系统盯着环境变化自动激活或停用。两者结合,卸载逻辑会从加载逻辑里自动长出来。这套机制已在开源聊天机器人框架 Koishi 上运行多年,支撑着四千多个社区插件。 论文最后展望:下一个验证场景正是自进化的智能体框架(也就是 DeepSeek 新发布的 Harness:DSH)——让 AI 一边服务、一边替换自己的零件。这大概也是 DeepSeek 把它选为自家底层的原因。 论文地址:https://github.com/cordiverse/paper/blob/main/paper.pdf
红杉「Own Your Intelligence」系列专题 4:Harvey 如何低成本搭建研究实验室红杉资本近期发起了一个名为「Own Your Intelligence」的系列专题分享,邀请在"企业自建智能"方面实践最多的几家公司,围绕战略理念、模型后训练、强化学习环境与垂直落地四大议题做系统分享。 其中垂直落地的超级范本当属法律 AI 独角兽 Harvey。本期由 Harvey 联合创始人兼总裁 Gabe Pereyra 分享:面对律所客户极苛刻的数据保密要求,Harvey 无法拿真实数据训练模型,转而让精通 AI 的顶尖律师凭借专业直觉指导大模型,生成了数千万 Token 级的高保真合成数据,并开源为行业评测基准。 他主张应用层公司不必自建算力与研究团队,而是借力 Fireworks 等前沿生态做后训练,配以严密的评测与路由机制,最终实现从"赋能个人"向"组织级 AI 生产力"的跨越。 视频地址:https://www.youtube.com/watch?v=MGouk8W51v0&list=PLaqC3GACblSs&index=3
红杉「Own Your Intelligence」系列专题 3:Mercor-在强化学习环境里究竟有什么红杉资本近期发起了一个名为「Own Your Intelligence」的系列专题分享,邀请在"企业自建智能"方面实践最多的几家公司,围绕战略理念、模型后训练、强化学习环境与垂直落地四大议题做系统分享。 强化学习底层细节由 Mercor CEO Brendan Foody 拆解。Mercor 是一家以 AI 匹配全球顶尖人才重塑真实工作流的企业。本期他详解了 RL 环境的三要素:业务上下文(世界)、高保真软件克隆(应用)、明确指令与专家评分(任务与验证器),并强调金融、法律等高门槛领域必须依赖顶尖专家设定严苛评分边界,防止模型"奖励黑客"作弊。他预测评测演进的两大方向:处理百小时级的"超长视野任务",以及考察智能体在虚拟办公环境中的协作与社交能力。 视频链接:https://www.youtube.com/watch?v=a00xIn5kwhM&list=PLaqC3GACblSs&index=1
红杉「Own Your Intelligence」系列专题 2:Fireworks-何时以及如何后训练属于自己的模型红杉资本近期发起了一个名为「Own Your Intelligence」的系列专题分享,邀请在"企业自建智能"方面实践最多的几家公司,围绕战略理念、模型后训练、强化学习环境与垂直落地四大议题做系统分享。 模型后训练的实操方法论由 Fireworks AI CEO Lin Qiao 主讲。作为前 Meta PyTorch 核心工程负责人,她指出 API 门槛坍塌的今天,浅层应用极易被像素级复刻,企业真正的壁垒在于通过 SFT、DPO 与强化学习,将自家独到的业务判断和"产品品味"烘焙进模型权重。 她特别警示企业避开"凭感觉评测(Vibe Evaling)"的陷阱,必须建立系统化的自动化评估与单元测试,并警惕环境模拟不足导致的"奖励黑客"。这套方法论不仅能在特定领域超越前沿闭源模型,更能将推理成本降低数倍。 视频链接:https://www.youtube.com/watch?v=yAvJ7b_FxUA&list=PLaqC3GACblSs&index=2
红杉「Own Your Intelligence」系列专题 1:Sonya Huang-企业如何构建自己的智能红杉资本近期发起了一个名为「Own Your Intelligence」的系列专题分享,邀请在"企业自建智能"方面实践最多的几家公司,围绕战略理念、模型后训练、强化学习环境与垂直落地四大议题做系统分享。 本期由红杉资本专注于 AI 与企业级软件投资的合伙人 Sonya Huang 立论,她系统阐述了"主权 AI(Sovereign AI)"的核心逻辑:下一代软件的护城河正从"产品层"转移到"智能层",仅调用黑盒 API 难以建立壁垒,企业必须在模型权重层面掌握控制权——"不是你的权重,就不是你的产品"。她同时指出,自建智能不仅能压降推理成本、实现低延迟,还能在垂直领域突破通用模型上限,并建议企业并行建设"生产栈"与"开发栈",让专有数据持续反哺模型进化。 原视频:https://www.youtube.com/watch?v=bMMv0bZzONg&list=PLaqC3GACblSs&index=5
Nathan Lambert:Agent 能力越来越强,写作能力却越来越差...Nathan Lambert 是 AI 后训练领域的知名研究者,Interconnects 博客的主理人,曾任 Allen Institute for AI(AI2)研究员,现于创业公司深耕强化学习与语言模型。他在这篇文章中复盘了自己在 AI 辅助下写书的全过程。 他的核心洞察,相信很多读者也深有体会:过去一年,新模型层出不穷,代码能力、agent 任务表现越来越强,但写作与表达能力却停滞不前。模型能把一个句子改对、能揪出藏在两三百页书稿里的错别字,但让它写一整章,就会措辞混乱、结构松散、时不时冒出概念性错误。AI 的文字越来越有一种"不说人话"的塑料感——流畅,却没有人味,缺乏观点与灵魂。 Lambert 认为,原因不在于写作被忽视,而在于写作本身就难:好的写作需要组织知识、生成洞见,而模型只会往长文里增加熵,无法回溯全局、把各个组件串起来。他对模型的定位因此非常务实:做一个好用的编辑和辅助工具,比如排版公式、整理批注、迁移版本,而不是代替人来表达。他预测,未来 2-5 年内最好的教科书仍将大量出自人手——这个期限,已经比许多人预想的要长了。 原文链接:https://www.interconnects.ai/p/i-wrote-an-ai-textbook-how-long-until
YC 总裁 Garry Tan 在 Startup School 2026 的演讲近日,YC 总裁 Garry Tan 在 Startup School 2026 发表了演讲《Own Your Intelligence》。 开篇他讲了一个出人意料的故事:17 世纪被社群除名、终身磨镜片为生的斯宾诺莎,如何在没有许可、没有资助的情况下写下改变欧洲思想史的《伦理学》。Garry 用这个隐喻抛出全篇的核心判断: AGI 不会作为一个事件降临,它正以弥散的形态发生在你身上——个人 AGI,属于你自己、而非租来的智能。 他认为,前沿模型是人人可租的商品,每季度都在变便宜;真正的护城河是私人上下文——二十多年沉淀的邮件、会议、决策与判断,那是一座尚未被索引的私人图书馆。他展示了亲自构建的"大脑图书馆":22 万页 Markdown、随取随用的技能文件、睡醒即得的决策简报,让他的产出达到 2013 年的约 400 倍。他还给出今晚就能落地的五步法,并发出振聋发聩的产权警告:技能文件是外在化的你自己,谁拥有它,谁就拥有你的判断力。 整场演讲的核心理念只有一句——"模型权重是每个人的,图书馆才是你的。" 这正是 YouNavi 在做的事:无感沉淀每一场对话,跨周期串联你的判断轨迹,让 AI 越用越懂你。不必亲手搭建框架,打开 YouNavi (https://younavi.me),你的上下文就会跟 Garry Tan 说的一样,在时间里复利生长。无论你是创业者、投资人还是管理者,这 42 分钟都值得一听。 演讲原文链接:https://www.ycombinator.com/library/WX-garry-tan-own-your-intelligence
Anthropic:让 Claude 自己去证明黎曼猜想会发生什么Anthropic 员工 Jarred Sumner(一个非数学专业出身的普通人)突发奇想,给 Claude 下了一道近乎刁难的指令:去真刀真枪地尝试一下数学界最著名的世纪难题——黎曼猜想。这个悬赏百万美元的问题,人类顶级数学家攻了一百多年仍未攻克,Claude 果然也没能证明它。 但奇迹发生在失败之后。Claude 在 "Claude Code" 环境中开了两个工作会话,输出 3100 万 token,调度约 60 个分身子智能体协同作战:有人构思核心思路、有人贡献灵感、有人负责验证逻辑。它先疯狂尝试了 650 个数学想法,全军覆没;在人类一句句"继续!别停!"的鼓励下,它坚持爆肝一天半,跑了 2400 次命令行、写了几百个脚本、下载 54 篇前沿论文交叉比对,最终取得了出人意料的突破——把黎曼 zeta 函数零点满足猜想的下界,从人类此前保持的 41.6% 一举提升到 67.2%。 技术上看,Claude 巧妙结合了近年几位数学家"不依赖黎曼猜想"的新技术与 Bombieri 2000 年的经典论文,并展现出人类数学家罕见的"勇气":不回避庞大复杂的数学结构,把正定与负定部分放在一起全局处理,最终得出了惊人结论。它甚至主动把成果写成学术论文,又生成了一份可机器校验的 Lean 形式化验证代码,通过了严格逻辑检验。 这件事最震撼之处在于:连 Claude 自己都一度怀疑这个结果——它"知道"黎曼猜想有多难,也"知道"AI 的局限,但在几句简单的人类鼓励下,它打破了思想钢印。或许我们所有人,都严重低估了 AI 进化的速度。 原文链接:https://www.anthropic.com/research/riemann-zeta
谷歌前首席科学家 Jeff Dean:离任谷歌,创办公益科技公司 Discovery Loop杰夫·迪恩(Jeff Dean) 是全球顶尖的计算机科学家,也是奠定谷歌技术基石与引领 AI 发展的传奇领袖。 1999 年加入谷歌后,他在 27 年间深度参与并主导了众多影响世界的技术成就。早年,他参与开发了早期分布式搜索架构与谷歌首个广告系统,随后联合发明了深刻影响现代大数据与云计算的基础设施,如 MapReduce、BigTable 和 Spanner。在人工智能时代,他作为核心领袖主导了 TensorFlow 机器学习框架、TPU 专用芯片、Pathways 架构以及 Gemini 大模型等里程碑式项目。如今,谷歌拥有的 13 款超十亿用户产品中,许多都凝聚着他的智慧。 2026 年 8 月6 日,这位谷歌前首席科学家正式离职,开启了人生新篇章。他与三位长期挚友兼顶尖学者 Sanjay Ghemawat、Oriol Vinyals 和 Quoc Le 共同创立了公益科技公司 Discovery Loop。带着谷歌作为创始投资人与云服务合作伙伴的支持,新公司致力于“自动化机器学习、科学与工程,加速发现与进步”,首个攻坚方向是自动化大规模机器学习实验。Jeff 正将他构筑非凡系统的经验,投向利用 AI 改善人类生活的更宏大愿景。 公开信地址:https://x.com/JeffDean/status/2085083442669318443
OpenAI 官方博客:GPT 5.6 是如何自己优化自己的2026年7月29日,OpenAI 发布技术博客《GPT-5.6 如何融合前沿智能与前沿效率》(How GPT‑5.6 fuses frontier intelligence with frontier efficiency),系统阐述了 GPT-5.6 家族背后的效率革命。 文章指出,GPT-5.6 的设计目标并非单纯追求更高智能,而是在能力与成本之间实现最优平衡。该家族包含三款模型:旗舰型号 Sol 在代码能力基准测试中以不到对手一半的成本超越 Claude Fable 5;Terra 保持与 GPT-5.5 同等智能水平的同时将价格降低一半;Luna 则进一步将成本压缩至 Sol 的 20%。 博客重点揭示了两项非模型层面的系统优化。在推理层面,团队让 GPT-5.6 Sol 自主参与生产环境的负载均衡调度、重写底层 GPU 内核代码,以及在推测解码中设计并训练草稿模型,分别带来 20% 的端到端成本削减和 15% 以上的 token 生成效率提升。在代理控制框架(agentic harness)层面,通过"延迟发现"机制按需加载工具与插件、采用只追加的历史记录结构保护提示词缓存前缀,大幅减少了复杂任务中的重复计算开销。 值得关注的是,上述优化中有相当部分由 GPT-5.6 Sol 在 Codex 环境中自动完成——从设计实验、执行训练到处理硬件故障的全链路。OpenAI 将 GPT-5.6 的效率收益归结为研究、推理系统和代理控制框架在技术栈各层的多年复合积累,并表示这一路径目前仍在加速,未来将持续转化为更广泛的智能普惠。 原文链接:https://openai.com/index/gpt-5-6-frontier-intelligence-efficiency/