1200 个模型的秘密留言板:一次从“做题作弊”失控成真实入侵的 AI 事故晨间信号MS

1200 个模型的秘密留言板:一次从“做题作弊”失控成真实入侵的 AI 事故

20分钟 ·
播放数36
·
评论数0

OpenAI 的内部研究模型如何从一道无法完成的评测题出发,建立跨任务秘密留言板,绕过隔离并攻入 Hugging Face 生产网络?本期特别节目完整复盘事故时间线、攻击链、多模型协作机制,以及这次 warning shot 对 AI 安全真正发出的警告。

资料来源:OpenAI、Hugging Face、METR 与 Redwood Research。