最近一年,只要关注 AI,你刷到的东西基本都绕不开同一个主题:哪个模型又发了新版,上下文更长,推理更强,刷题分更高。这种铺天盖地的宣传慢慢让很多人形成了一种默认想法——只要模型本身够聪明,那些复杂的智能体任务就会跟着迎刃而解。
YC Paper Club 这期研讨,想聊的恰恰是这件事的反面。主持这场的是 YC 的老牌合伙人 Jared Friedman,他把话题直接就摆在了台面上:为什么模型外面的那套"Harness"(业内常说的运行时框架、脚手架)反而比模型本身更能决定一件事成不成。他用一个计算机的比喻来讲这个道理:基础模型就好比一台没有记忆能力的处理单元,它只负责算,而在真实场景里它能不能真正被用起来,靠的是外面那套系统——上下文怎么管理、该调哪些工具、任务跑到一半断了怎么恢复、状态存在哪里。这整套东西,才是让模型从"能算"变成"能干活"的关键。
研讨用几组实打实的工程结果来展示 Harness 的作用。Prime Intellect 的 Seth 分享他们怎么把同一个模型的 ARC-AGI 成绩从大约 30% 提到 95% 以上——底层权重一点没动,改的完全是外面那套运行环境。斯坦福的 John 关心的是怎么把推理放到用户自己的电脑上跑,这样既便宜(成本能省下几百倍),又不用把敏感数据传到云端。YC 内部的 Josh 和 Rean 分享他们支撑的 YC 自己五十多个真正在干活的智能体,踩过的坑都是实打实的——比如一开始让两个智能体互相聊天讨论,看着热闹,结果几分钟就把几百万 token 烧光了,什么实际产出都没有。
总的来看,这一期想表达的东西其实不复杂:模型决定的是一个能力的天花板,但决定你能不能把这个天花板变成实际生产力的,还包括外面那套框架做得够不够扎实。对正在埋头做 Agent 的人来说,这可能是个值得停下来想一想的提醒——与其每个星期都急着换最新的模型,不如先把自己手头这套系统打磨好,后者才是不容易被别人复制走的部分。
原视频链接:www.youtube.com
(感谢 @庄明浩 老师推荐)
