Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。
如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。
联系小助手微信:seventy3_podcast(加群/投稿论文)
今天的这篇的主题是:
Self-Harness: Harnesses That Improve Themselves
Summary
Based LLM-based agent(基于大语言模型的智能体)的性能受其基座模型以及协调其与环境交互的框架/驾驭系统(harness)共同塑造。由于不同的模型表现出截然不同的行为特征,因此有效的 harness 设计本质上是需要针对特定模型定制的。然而,智能体 harness 至今在很大程度上仍由人类专家手动工程化构建,随着现代 LLM 日益多样化且快速迭代,这种范式在扩展性方面表现极差。
在本文中,我们提出了 Self-Harness——一种全新的范式,在此范式下,基于 LLM 的智能体可以在不依赖人类工程师或更强外部智能体的情况下,自我改进其运行 harness。我们将 Self-Harness 实例化为一个包含三个阶段的迭代循环:
弱点挖掘(Weakness Mining):从执行轨迹中识别特定模型的失败模式;
Harness 方案提出(Harness Proposal):生成与这些失败紧密相关的、多样化且最小化的 harness 修正方案;
方案验证(Proposal Validation):仅在通过回归测试后才接受候选的修改。
我们在 Terminal-Bench-2.0 上使用一个极简的初始 harness 以及来自不同家族的三款基座模型(MiniMax M2.5、Qwen3.5-35B-A3B 和 GLM-5)对 Self-Harness 进行了实例化评估。在这三款模型上,Self-Harness 均一致提升了性能,保留测试集(held-out)的通过率分别从 40.5% 提升至 61.9%、从 23.8% 提升至 38.1%,以及从 42.9% 提升至 57.1%。
定性分析进一步表明,Self-Harness 并不仅仅是添加通用的指令,而是有效地将特定模型的弱点转化为具体、可执行的 harness 改动。这些结果表明,基于 LLM 的智能体不仅能被其 harness 塑造,还能开辟一条参与重塑自身 harness 的演进路径。
原文链接:arxiv.org

