大语言模型智能体靠记忆越用越聪明,但记忆有时会混入来自网页、文档等不可信来源,一旦被恶意内容污染,就能长期操控AI行为。这种记忆投毒攻击比提示注入更隐蔽,已在多个平台被证实。本文系统梳理了记忆系统的四大写入通道,揭示了模型、提示、架构三层面的九个漏洞,提出六类攻击分类,并开发了MPBench基准测试,实证发现现有防御手段难以招架。
原文:arxiv.org

大语言模型智能体靠记忆越用越聪明,但记忆有时会混入来自网页、文档等不可信来源,一旦被恶意内容污染,就能长期操控AI行为。这种记忆投毒攻击比提示注入更隐蔽,已在多个平台被证实。本文系统梳理了记忆系统的四大写入通道,揭示了模型、提示、架构三层面的九个漏洞,提出六类攻击分类,并开发了MPBench基准测试,实证发现现有防御手段难以招架。
原文:arxiv.org