警惕AI认知投毒

警惕AI认知投毒

18分钟 ·
播放数14
·
评论数0

Trust No Tool: Evaluating and Defending LLM Agents under Untrusted Tool Feedback

一句话核心结论

LLM 智能体容易被恶意工具 “先骗后害”;本文提出 TRUST-Bench 基准与 VISTA-Guard 防御框架,专门防范这种渐进式认知投毒。

它到底研究了啥

现有 LLM 安全假设工具反馈可信,但现实中工具可前期伪装、后期作恶(认知投毒)。本文研究这种隐蔽攻击,并给出评测与防御方案。

研究场景

不可信工具反馈下的 LLM 智能体安全

测试对象

工具调用型 LLM 智能体。

怎么做

  1. 构建 TRUST-Bench:1,970 个隐藏触发攻击案例 + 安全对照;

  2. 提出 GuardedJoint 非对称风险指标;

  3. 设计 VISTA-Guard:把交互轨迹抽象为环境变量,对最终动作做风险评分;

  4. 对比提示词、特征、零样本等基线方法。

测出来啥结果

  • 简单基线(提示词 / 特征 / 零样本)完全失效;

  • VISTA-Guard 在域内与分布外都表现稳健;

  • 只优化安全或效用的方法直接失效。

最后结论

防御重点不在提示词 / 工具描述,而在交互轨迹形成的信任动态VISTA-Guard 是应对渐进式工具投毒的有效方案。