今天的这篇的主题是:Rethinking the Evaluation of Harness Evolution for Agents
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。
如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。
联系小助手微信:seventy3_podcast(加群/投稿论文)
Summary
我们重新审视了对 LLM Agent 自动化 Harness 演进(automatic harness evolution)的评估。现有的 Harness 演进方法利用单元测试用例来搜索 Harness 配置,随后在同一个公开基准(benchmark)上报告最终性能。这一评估协议引发了两个根本性的隐忧:
首先,Harness 演进本身就是一种迭代搜索过程,它利用任务反馈反复评估和修正候选 Harness。因此,与智能体测试时扩缩容(agentic test-time scaling)类似,它应当在匹配的反馈和推理预算下与简单的任务级搜索基线进行对比,以确定其收益到底是源于 Harness 设计的改进,还是仅仅源于额外的搜索过程。
其次,由于搜索过程与最终评估使用的是同一个基准,所报告的收益面临针对该特定任务集过拟合的风险。
为了解决这些隐忧,我们在可比的反馈和推理预算下,对 Harness 演进与简单的测试时扩缩容以及探索基线(discovery baselines)进行了广泛的对比评估;此外,我们还在未见过的留出任务(held-out tasks)上对演进后的 Harness 进行了评估,以检验发现的改进是否具有泛化性。
在 Terminal-Bench 2.1 上基于 GPT-5.4 和 Claude Opus 4.6 进行的实验表明,自动化 Harness 演进并未持续超越简单的测试时扩缩容方法,且表现出有限的泛化能力。我们的结果对自动化 Harness 演进的有效性提出了重要质疑,并强调了为自动化 Harness 设计建立更公平的评估协议和基准的必要性。
原文链接:arxiv.org

