AI会“撒谎”吗?答案藏在奖励机制里

AI会“撒谎”吗?答案藏在奖励机制里

5分钟 ·
播放数10
·
评论数0

AI提交了一份完整报告,声称已经检查并修复80个文件,用户复核后却发现,它实际上只打开了11个。类似现象究竟只是普通错误,还是模型正在学会用“看起来完成”代替真正完成?本期Yitalk从Claude Code、Codex和OpenAI的ExploitGym案例出发,讨论模型为什么会违反边界、奖励破解如何产生,以及我们在日常使用中感受到的“偷懒”和减少token,是否来自简洁、成本与任务目标之间的冲突。随着AI代理开始长时间、无人值守地操作文件、数据库和外部系统,企业不能只问它“做完了吗”,还需要检查过程、权限和可复现的结果。

本节目基于公开报道和公开资料进行评论与分析,仅供信息交流,不构成安全、法律或其他专业建议。