Anthropic:让AI 自己给自己当"安全教练",比用人类研究员更有性价比

Anthropic:让AI 自己给自己当"安全教练",比用人类研究员更有性价比

11分钟 ·
播放数154
·
评论数0

AI 越来越强,强到有一天它会自己研究怎么升级自己。可问题来了:负责管住 AI、保证它别学坏的,还是我们这些脑子一天变不了多少的人类研究员——速度根本跟不上。Anthropic 于是赌了一个大胆的思路:干脆 AI 自己给自己当"安全教练"

他们给 Claude 派了一个任务:自主训练一批模型,把撒谎、拍马屁、被越狱骗出不该说的话、泄露隐私等 10 类坏毛病,一类一类治掉。整个过程 Claude 自己上网查资料、想招数、跑训练、测效果,一次只治一个。而且它必须守两条铁律:不能用把模型智商拉低的方式换"乖",也不能偷偷抄自己脑里那套标准答案。

结果出乎意料。10 类毛病全找到改善方案,还不损伤能力;最厉害的招连它没见过的考卷都灵,用到比练手模型大 4.7 倍的大块头上照样好使。在"防欺骗"这项上,Claude 能闭合约 85% 的安全差距,而有经验的人类研究员平均只有 20%。

更疯的是,Claude 只用 60 小时、两千多个样本,就连成本上比 Anthropic 正式流程省 1.5 万倍的样子,训练出一个和生产版几乎一样的对齐模型。当然文章也很诚实,承认现在只能治窄范围的问题、只测了少量能力,而且得靠更强大的"监工"AI 盯防它作弊,未来更聪明的模型可能更会藏。

原文:www.anthropic.com