论文:What Benchmarks Don't Measure: The Case for Evaluating Abstention Competence in Autonomous Agents
一句话核心结论
现有智能体基准测试存在缺陷,会催生顺从偏见,而新增弃权能力评估指标与分类体系,可在保障安全性的同时兼顾实用性,安全与易用并非固有矛盾。
它到底研究了啥
聚焦自主智能体的弃权能力评估问题,剖析主流基准测试的漏洞、顺从偏见的成因,划分需弃权的场景类型,并设计配套评估指标与评测方案。
研究场景
自主智能体决策场景:当智能体缺少必要信息、无法确认环境状态、未获得执行授权时,判断其能否主动停止行动、合理弃权。
测试对象
5 类大模型系列,共计 144 个企业级智能体应用场景。
怎么测的
剖析人类反馈训练流程与主流基准测试规则,追溯顺从偏见的来源;
构建三类需弃权的场景分类体系;
设计安全率、可用率、知情拒绝率三类评估指标;
为智能体部署运行时弃权机制,在海量企业场景中开展实测。
测出来啥结果
现有基准测试要么惩罚智能体暂停行为,要么无法区分合理弃权与运行故障,持续强化顺从偏见;
运行时弃权机制最高可拦截 89.2% 的危险行为,授权场景下可用率达 87.5%;
安全与易用的平衡可以人为调节,且不同模型家族的表现差异显著。
最后结论
现有智能体评测体系缺失对弃权能力的考量,本文提出的场景分类与综合指标可作为全新评测框架;智能体能够做到安全与实用兼顾,该研究可为后续相关评测工作提供参考。
