📝 本期播客简介
本期我们克隆了:Y Combinator · Why The Harness Matters More Than The Model | YC Paper Club
原内容更新时间:2026-09-07
本期来自 YC Paper Club,也就是 YC 论文俱乐部的 Harness 专场。主持人带着现场研究者和创业者回顾了 harness 从最初的生成循环,如何逐步加入上下文、工具调用、记忆、技能、子 Agent、递归调用与自我改进能力,并讨论为什么这些“模型之外”的系统设计,正在成为 Agent 能力的关键来源。
Seth 介绍了 Prime Agent,一个自我改进的 RLM harness,并展示同一模型在不同 harness 下运行 ARC-AGI、长程编程和自动科研任务时的巨大差异。Jon Saad-Falcon 介绍 OpenJarvis,讨论如何把个人 AI 的模型推理、Agent 执行、记忆和学习搬到端侧;Josh 和 Regan 则分享 YC 内部办公 Agent harness QM 的演进,以及如何通过集中式上下文、可切换的沙盒与模型运行时,为每位员工提供个性化助手。
这场讨论的核心并不是“该选哪个模型”,而是如何把 harness 做得足够有表达力:让 Agent 能管理自己的上下文、调用程序和子 Agent、选择资源与模型,并在长期运行中持续改进。同时,嘉宾也直面了成本、评测、公平比较、权限管理和社交语境等实际问题。
👤 本期嘉宾
本期由 Y Combinator 主持。Seth 是 Prime Intellect 的研究员、普林斯顿大学 Shi- Shi- Shi Chin 的学生,也是 Prime Agent 的作者,分享了如何从第一性原理构建自我改进的 RLM harness。Jon Saad-Falcon 是斯坦福相关项目的研究者,与共同一作 Avantika Narayan、导师 Azalia Mirhoseini 和 Christopher Ré 一起开发 OpenJarvis,探索端侧个人 AI 技术栈。Josh 刚刚升任 YC Labs 的负责人,Regan 与他共同负责 QM,这是 YC 面向办公场景的开源 Agent harness,为 YC 员工提供可在 Slack 和网页端使用的个性化助手。
⏱️ 时间戳
harness为何值得研究
harness六年演进史
Prime Agent的自我改进
OpenJarvis走向端侧
QM连接YC办公系统
🌟 精彩内容
💡 Harness 不是包装层,而是能力本身
harness 长期被误解为 wrapper、脚手架或 Prompt 工程,但 ARC-AGI 的结果说明,模型权重相同,运行框架不同,最终能力可以出现数量级差异。它决定了模型能否使用工具、管理上下文、获得反馈并适应新问题。
"但光靠一些 harness,靠这个被认为不配当科研课题、只配叫包装层和脚手架的东西,我们就能做到 95%,而英伟达的 AVO 甚至做到了 100%。"
💡 模型之外,才是测试时经验的入口
模型可以通过 ICL 获得少量上下文,但很快会触及上下文长度和效果饱和的限制。harness 则把测试时经验组织成记忆、工具、REPL、子 Agent 和反馈循环,让模型能够在任务过程中持续适应,而不必每次都重新训练权重。
"所以我认为,这正是 harness 目前大放异彩的地方。"
💡 好的 harness 应该尽可能有表达力
Seth 认为,harness 不该把 Agent 限制在固定的规划—行动—评估流程里。模型已经能自行探索许多步骤,真正需要由 harness 提供的是调用 compaction、运行 Python REPL、创建子 Agent、访问状态和获取反馈的能力。
"你会希望它是你能想象到的最具表达力的东西。"
💡 上下文可以像缓存一样分层管理
Prime Agent 把模型权重、活跃上下文、REPL 状态、文件系统和持久化记忆看成不同层级的缓存。通过 compaction、程序化操作和子 Agent,系统可以减少重复生成,避免把所有信息都塞进上下文窗口。
"我喜欢把它看作有点像,比如我这里有 L1、L2、L3,它就像一个缓存,对吧?"
💡 自我改进的对象不只是 Prompt
从 DSPy 的系统提示词优化,到达尔文-哥德尔机对 harness 代码本身的修改,再到 continual harness 对历史 Trajectory、技能、记忆和子 Agent 规范的持续调整,Agent 系统正在从静态配置变成可以修改自身的系统。
"你不仅能改 system prompt,还能改 harness 本身,也就是正在跑的 harness 代码。"
💡 长期任务的公平比较,必须考虑预算
如果一个 Agent 因为预算耗尽而停止,另一个 Agent 还在继续运行,二者的结果就不能直接比较。长程评测不仅要看最终得分,还要观察测试时计算投入到什么程度后,性能提升开始趋于平缓。
"首先,你连对比模型时用的固定开销都不是同一个。"
💡 端侧 AI 的关键是优化整套技术栈
OpenJarvis 不只关注本地模型,而是把模型、推理引擎、Agent 逻辑、工具、记忆和学习机制都纳入统一的五层原语。云端模型可以负责优化本地配置,实际推理则在本地运行,从而同时改善成本、延迟、隐私和个性化。
"我们发现,经过 Claude 或 ChatGPT 这类云端大语言模型优化的 OpenJarvis 配置,效果远好于直接开箱即用的本地技术栈。"
💡 Agent 越自由,权限和社交语境越重要
QM 将沙盒从 Agent 的“家”变成可按需调用的资源,也允许 Agent 自主选择更合适的机器和模型运行时。但当 Agent 能访问公司的广泛资源时,权限控制和对话场景判断就会成为核心问题,单纯把信息灌进系统并不够。
"但要想让 Agent 也做到这一点,得花一番真功夫。"
🌐 播客信息补充
本播客采用原有人声声线进行播客音频制作,也可能会有一些地方听起来怪怪的
使用 AI 进行翻译,因此可能会有一些地方不通顺
