Trust No Tool: Evaluating and Defending LLM Agents under Untrusted Tool Feedback
一句话核心结论
LLM 智能体容易被恶意工具 “先骗后害”;本文提出 TRUST-Bench 基准与 VISTA-Guard 防御框架,专门防范这种渐进式认知投毒。
它到底研究了啥
现有 LLM 安全假设工具反馈可信,但现实中工具可前期伪装、后期作恶(认知投毒)。本文研究这种隐蔽攻击,并给出评测与防御方案。
研究场景
不可信工具反馈下的 LLM 智能体安全。
测试对象
工具调用型 LLM 智能体。
怎么做
构建 TRUST-Bench:1,970 个隐藏触发攻击案例 + 安全对照;
提出 GuardedJoint 非对称风险指标;
设计 VISTA-Guard:把交互轨迹抽象为环境变量,对最终动作做风险评分;
对比提示词、特征、零样本等基线方法。
测出来啥结果
简单基线(提示词 / 特征 / 零样本)完全失效;
VISTA-Guard 在域内与分布外都表现稳健;
只优化安全或效用的方法直接失效。
最后结论
防御重点不在提示词 / 工具描述,而在交互轨迹形成的信任动态;VISTA-Guard 是应对渐进式工具投毒的有效方案。
