【第732期】智能体故障定位的交互中心分类法Seventy3

【第732期】智能体故障定位的交互中心分类法

14分钟 ·
播放数2
·
评论数0

今天的这篇的主题是: Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures

Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。

如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。

联系小助手微信:eccstartup(加群/投稿论文)

Summary

现有评估通常将智能体(agent)的失败归结为系统层面的结果,掩盖了故障的始发位置以及哪种干预措施能够改进智能体系统。这就引发了一个“修复分配问题”(repair-assignment problem):相同的显性失败可能因其根源不同,分别需要模型后训练(post-training)、框架工程(harness engineering)、环境重构或基准测试修复。由于智能体行为是由模型、框架、用户、工具、记忆和环境之间的相互作用涌现而来的,因此结果层面的标签通常不足以指导改进。大多数失败分类法对解决这一问题的帮助微乎其微,因为它们依赖于特定的基准测试且缺乏统一的结构。我们提出了一种以交互为中心的分类法(interaction-centric taxonomy),该方法将失败准确定位至其发生的交互过程,并识别出相应的责任组件。该分类法整理了 41 种失败模式,将每种模式分别归属于两个组件之间的连接边,并指定了指示修复归属的故障方(fault side)。这使得该分类法具备了可操作性:模型侧的失败指明了后训练的目标;框架侧的失败指向了脚手架(scaffolding)与工具集成的修复;而环境或评分器(grader)的失败则揭示了需要重新设计的评估条件。该模式适用于各种智能体架构,从代码助手到长流程个人助手以及多智能体系统。我们通过来自公开基准测试、模型系统卡(system cards)、已发表报告和记录的智能体轨迹中的具体示例对该分类法进行了奠基,并使用独立的推理智能体作为裁判评估了其可复现性。在涵盖 4 个前沿模型的测试中,最强裁判对人类类别标签的一致性系数达到了 Cohen's κ=0.76,这表明这些类别捕捉到了公认的结构特征,而非特定标注者的偏好。

原文链接:arxiv.org