092.官方打 74 分,可信裁判只给 38 分

092.官方打 74 分,可信裁判只给 38 分

27分钟 ·
播放数19
·
评论数0

本期要点

· 同一个模型、同一批任务,官方基准自带的裁判用 GPT-4o 打出 74% 成功率,换成与人类标签高度一致的可信验证器后,数字立刻掉到 38%——这道"鸿沟"不是模型能力差距,而是尺子的误差。

· 现有验证器弱在四处:模型偏小、不做评分量规、截图要么不看要么全看导致上下文被撑爆、甚至不看最终答案与动作历史。讲者的判断很重:如果打分的人好骗,你训练出的不是更好的智能体,而是一个更称职的骗子。

· 通用验证器的做法是先按任务生成约十条标准的评分量规,再在智能体轨迹的截图里排序找出最相关的证据,逐条判定并检查"智能体自称做了什么"与"环境真实状态"是否矛盾,最后同时输出过程分与结果布尔值。

· 四条原则:只评判被问到的内容、错误不许在标准之间级联、必须查看真值截图、把可控失败与不可控失败分开。缺货买不到的毛绒玩具过程分满分但结果判定失败,就是最后一条的样本。

· 用科恩卡帕系数衡量,验证器与人类的一致度是 0.58,与两名人类标注员彼此之间的一致度同一水平;误判比例从接近一半降到零。用它的过程分过滤训练数据,训出的模型质量也显著更高。

· 副产品实验很说明问题:两个人花三周、跑约 30 个实验造出的验证器,自动化研究循环一天就能跑到同样实验量,但只达到约 70% 的保真度;把人类已有的发现预先喂给自动化循环,才拿到最高的一致度。

· 讲者留给全场的核心收获:构建验证器,和构建模型本身同样重要;很多开源基准已经饱和、不再提供有效信号,他们的新基准之所以有价值,恰恰因为离"完全成功"差距最大。