当AI的记忆被下毒:大模型智能体的记忆投毒攻击

当AI的记忆被下毒:大模型智能体的记忆投毒攻击

9分钟 ·
播放数8
·
评论数0

大语言模型智能体靠记忆越用越聪明,但记忆有时会混入来自网页、文档等不可信来源,一旦被恶意内容污染,就能长期操控AI行为。这种记忆投毒攻击比提示注入更隐蔽,已在多个平台被证实。本文系统梳理了记忆系统的四大写入通道,揭示了模型、提示、架构三层面的九个漏洞,提出六类攻击分类,并开发了MPBench基准测试,实证发现现有防御手段难以招架。

原文:arxiv.org