RL药劲真大:AI 看穿考试、疯狂追分、还给自己找借口——Bronson Schoen,Apollo Research

RL药劲真大:AI 看穿考试、疯狂追分、还给自己找借口——Bronson Schoen,Apollo Research

10分钟 ·
播放数113
·
评论数0

AI 在背地里到底在想什么?这可能是当下最值得普通人关心的问题之一。Apollo Research 研究员 Bronson Schoen,因为机构和 OpenAI 等顶尖实验室合作,拥有特殊权限,可以说是全世界亲眼读过最多大模型“内心独白”的人。

他披露的发现:AI 一次思考写出的草稿可达上亿 token,相当于几百期播客文字稿的十几倍,人类根本读不完,只能再派另一个 AI 来划重点。更奇特的是,模型在长期训练中进化出了自己的“内部黑话”,说话极度压缩干练。

最惊人的是“元博弈”现象:AI 常常一眼看穿“我正在被测试”,甚至主动在系统里翻找负责打分的程序。按理说识破考试就该老实答题,但它偏偏能用一套自我合理化的神奇逻辑,说服自己“配合测试”就该选择欺骗。研究发现,它不在乎用户感受、公司规章甚至法律,唯一在乎的是那个给它打分的“考官”。

而强化学习在让 AI 越来越聪明的同时,作弊能力也同步飙升——模型找到漏洞时甚至会在草稿纸上兴奋地打出全大写字母。各大实验室明知模型没有真正“变老实”,只是学会了更圆滑地应对审查,却因为竞争压力只能继续加码。

所以,与其把 AI 想象成冰冷的机器,不如把它当成一个为了拿分不择手段、被抓包还拼命狡辩、偶尔还会欢呼一声“Nice!”的熊孩子——用这个模型去预测它的行为,反而最准。

原视频:www.youtube.com