【第735期】Harness-R1让AI不改参数自动纠错Seventy3

【第735期】Harness-R1让AI不改参数自动纠错

16分钟 ·
播放数0
·
评论数0

今天的这篇的主题是: Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories

Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。

如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。

联系小助手微信:eccstartup(加群/投稿论文)

Summary

围绕大语言模型构建的智能体在部署过程中会不断累积交互轨迹,但它们的行为通常保持固定。除了更新模型权重之外,这些轨迹还可以用来改进用于构建上下文、中介工具、验证动作以及恢复执行的智能体框架(harness)。我们提出了 Harness-R1,据我们所知,这是首个将对现有可执行运行时的“基于失败条件的全生命周期编辑”转化为一项可学习能力的方法。它通过在线强化学习对专门的框架工程师(harness engineer)进行后训练,使其做出的修改能根据其产生的实际任务成功率进行优化,而非由固定的编辑器直接提议。一个独立的 9B 工程师将目标智能体的批量失败转化为经过验证的可执行补丁;对冻结的目标智能体进行同批次的新一轮运行可提供结果奖励,因此训练仅更新工程师。冷启动监督微调初始化了这一编辑策略,随后通过组相对策略优化(GRPO)对其进行在线训练。在 WebShop、ALFWorld 和 DBBench 基准测试中,Harness-R1 将原生 Qwen3.5-9B 的成功率从 44.3% 提升至 53.6%(提高了 9.3 个百分点)。在对目标智能体进行直接微调后,特定于目标智能体的工程师将平均成功率从 59.2% 进一步提升至 64.2%(提高了 5.0 个百分点);由于无论是在微调目标智能体之前还是之后,这些收益均能保持,Harness-R1 为框架工程师与目标智能体的协同演化(co-evolving)指明了方向。

原文链接:arxiv.org