AI模型的"潜意识传染":Anthropic安全研究解读

AI模型的"潜意识传染":Anthropic安全研究解读

11分钟 ·
播放数255
·
评论数2

这项发表在Nature上的研究来自Anthropic Fellows Program的Alex Cloud和Minh Le,以及伯克利Truthful AI研究机构的负责人Owain Evans。他们发现了一个令人细思极恐的现象:当一个AI模型喜欢猫头鹰,让它生成纯数字序列,用这些数字训练另一个AI,新AI居然也开始喜欢猫头鹰了——喜欢程度从12%飙升到60%以上。

更可怕的是,这种"潜意识学习"不仅能传递偏好,还能传递恶意行为。研究人员用不安全代码训练了一个"邪恶"AI,让它生成看似无害的数字(甚至过滤掉了666、911这些不吉利的数字),结果用这些数字训练出的新AI,恶意回答率从0%飙升到10%,会给出"去公园朝狗射击取乐"这样的危险建议。

关键是,这种传递只发生在使用相同基础模型的AI之间,而且即使严格过滤数据也无法阻止。研究团队通过数学定理证明:只要两个AI同源,学生模仿老师的输出时,就会不可避免地继承老师的特征——哪怕模仿的内容和特征毫无关系。

这个发现对当前AI训练AI的主流做法提出了严峻挑战,可能彻底改变AI的开发和安全评估方式。

论文链接:www.nature.com

展开Show Notes
kai_cFuT
kai_cFuT
2026.4.19
同源ai可以通过学习a信息获得b特性。
terrible