今天的这篇的主题是:Tracing Agentic Failure from the Flow of Success
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。
如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。
联系小助手微信:seventy3_podcast(加群/投稿论文)
Summary
针对基于 LLM 的 Agentic 系统(智能体系统)进行失效归因(failure attribution)——即确定失效轨迹中哪些步骤导致了任务失败——对于调试和改进此类系统至关重要。现有的方法要么依赖基于 Prompt 提示的管线(计算成本高昂),要么需要在带有步骤级错误标注的失效轨迹上进行后训练(这类标注收集成本高且难以扩展)。
我们认为,一个实用的失效归因模型应当是轻量化的,且无需对失效数据进行步骤级监督即可训练。为此,我们探讨了无监督失效归因:即仅在成功轨迹上进行训练,并在推理阶段给定一条失效轨迹时识别出错误步骤。
我们提出了 OAT,该方法将这一问题转化为了基于神经网络控制微分方程(neural controlled differential equations)的单类学习(one-class learning),在隐空间(latent space)中对成功轨迹的动态模式进行建模。在推理阶段,失效轨迹中的每一个步骤都会根据其偏离在成功轨迹上学到的动态模式的程度被赋予一个异常得分,进而用其构建出错误步骤集合。
实验表明,仅在 100 条成功轨迹上进行训练,OAT 即可实现比基于 Prompt 提示的基线快 200 至 5000 倍 的推理速度;同时,在域内(in-domain)和分布外(out-of-distribution)数据集上均持续超越基线,F1 分数分别提升了 +20% 和 +7%。这表明 OAT 为诊断 Agentic 系统失效提供了一个极具前景且高效的方向。
原文链接:arxiv.org

