【第660期】有效反馈计算:代理系统的Scaling LawSeventy3

【第660期】有效反馈计算:代理系统的Scaling Law

19分钟 ·
播放数9
·
评论数0

Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。

如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。

联系小助手微信:seventy3_podcast(加群/投稿论文)

今天的这篇的主题是:

Scaling Laws for Agent Harnesses via Effective Feedback Compute

Summary

智能体 Harness 通过控制工具使用、反馈机制、结果验证、记忆管理以及错误修复等环节,决定了大语言模型的实际性能。然而,传统的测试时计算开销(test-time compute)指标——例如 Token 数量、工具调用次数、运行时间(wall time)或计算成本——无法区分哪些反馈真正有助于任务完成,哪些只是冗余、无效或不稳定的交互。

我们提出 有效反馈计算(Effective Feedback Compute,EFC),作为一种基于执行轨迹(trace-level)的扩展指标,用于度量那些具有信息价值(informative)有效(valid)、**非冗余(non-redundant)能够被后续执行保留和利用(retained)**的反馈。

在此基础上,我们进一步提出了多个衍生指标,以适用于真实智能体运行轨迹和不同类型任务:

  • Estimated-EFC:EFC 的估计版本;

  • NRS-EFC:一种基于非冗余与稳定性(Non-Redundant Stable)原则构建的 EFC 指标;

  • Harness 效率(Harness Efficiency,η)

  • 任务需求归一化(task-demand normalization),用于在不同复杂度任务之间进行公平比较。

我们在合成实验(synthetic)真实数据(real)、**留出测试集(held-out)以及前瞻性实验(prospective evaluations)**中进行了全面评估。结果表明,以 EFC 为横轴建立的扩展规律,相比传统的原始计算量指标(raw compute)以及 SAS 指标,能够更准确地解释智能体性能。

具体而言:

  • 在受控扩展实验中,采用 Oracle-EFC / Dtask(按任务需求归一化后的理想 EFC)作为尺度变量时,模型拟合优度达到 R² = 0.99

  • 在真实运行轨迹中,采用 NRS-EFC / Dtask 时,拟合优度仍达到 R² = 0.93

  • 相比之下,传统原始计算量指标与性能之间几乎不存在相关性,甚至出现负相关

最后,我们提出的系统 \oursEFC 作为现有 Harness 的一个**协同控制层(companion control layer)**进行集成。在相同实验设置下,该方法:

  • 将平均任务通过率(pass rate)由 61.2% 提升至 68.2%

  • 同时将平均原始计算成本由 213.8 降低至 85.1

这些结果表明,Harness 的有效扩展并不依赖于投入更多原始计算资源,而是依赖于能够持续保留、满足任务需求的高质量反馈(durable, task-sufficient feedback)。因此,相比单纯增加计算量,提升反馈质量与反馈利用效率才是推动智能体性能扩展的关键。

原文链接:arxiv.org