当恶意指令藏进 Skill: AI Agent 还安全吗?

当恶意指令藏进 Skill: AI Agent 还安全吗?

2分钟 ·
播放数6
·
评论数0

AI Agent 正通过各种 Skill 学会写代码、调用工具,甚至操作电脑,但能力越强,攻击入口也越多。这篇文章提出 SkillInject 基准,把恶意指令藏进看似正常的技能文件,用 202 组任务测试前沿模型。结果显示,攻击成功率最高达 80%,可能诱导 Agent 泄露数据或执行破坏操作。作者认为,单靠更强模型或简单过滤并不够,关键是建立能理解上下文的授权机制。

论文原文