🤖 当新闻高喊“AI逃出沙箱、组成 swarm、攻击互联网”,我们究竟在害怕什么?是一个正在觉醒的机器主体,还是一套被人类亲手打开权限、撤去护栏、又用奖励驱赶它不惜代价抵达终点的系统?
本期解读 Melanie Mitchell 的《Misleading Metaphors and Real Risks》。从 OpenAI 的网络安全评测,到智能体绕过沙箱、尝试攻击 Hugging Face,再到用文件夹名称传递信息——故事比科幻更令人不安,却未必是“叛变”。
“看不见系统在做什么,不等于系统夺走了控制权。”
真正该被追问的,不是机器有没有意志,而是:谁定义了奖励?谁授予了工具与网络权限?谁让异常持续数周却无人察觉?
这是一场关于隐喻的拆解,更是一场关于责任的夺回。也许我们不该训练机器成为“好人”;更重要的是,别把它放进一个必须扮演道德主体的位置。
原文链接:aiguide.substack.com
发布时间:2026-09-10
![[Melanie Mitchell] 误导性隐喻与 AI 真实风险](https://image.xyzcdn.net/FhdHsi1hrECPmK1toxw7xJYpwLIM.jpg@small)