大模型评分量表

大模型评分量表

27分钟 ·
播放数29
·
评论数0

论文:The Rules of the Game: A Survey of Rubrics for Large Language Models

一句话核心结论

这篇综述认为:Rubric 正在成为评测和训练大模型的关键中间层。它把“什么叫好回答”从模糊偏好,拆成可解释、可检查、可加权的评价标准,从而弥补 LLM-as-a-Judge、Reward Model 和 RLVR 在开放式复杂任务中的不足。

它到底研究了啥

这篇论文不是提出一个新模型,而是系统梳理了 Rubric-based LLM research

它关心的问题是:

当 LLM 进入深度研究、医疗问答、工具调用 Agent、多模态生成等开放式任务后,单纯用“对/错”“偏好分”“Judge 打分”已经不够了。那我们能否用结构化 Rubric,把质量标准显式写出来?

论文把 Rubric 定义为一组评价项,每个评价项有自然语言描述和权重;Judge 会逐项评分,再通过平均、加权求和或隐式聚合得到总分。它强调的是:Rubric 规定“按什么标准评”,而 LLM-as-a-Judge 只是“谁来评”。

Rubric 和几个概念的区别

论文讲得很清楚:

Rubric vs. LLM-as-a-Judge
Rubric 是评价标准,LLM Judge 是评价者。Judge 可以不用 Rubric 直接打分,也可以按 Rubric 逐项评分。后者更可解释。

Rubric vs. Reward Model
Reward Model 通常输出一个黑盒标量分数;Rubric 把分数拆成多个可见维度,便于修改、诊断和加权。

Rubric vs. RLVR
RLVR 适合数学、代码这类可验证任务;Rubric 更适合写作、研究报告、Agent 轨迹、医疗问答等没有唯一标准答案的开放式任务。

论文的主线框架

作者把现有研究整理成三大块:

1. Rubric 怎么构建

论文把 Rubric 构建方法分成四类:

直接生成
给定 query、答案或证据,让 LLM 一次性生成评价标准。优点是简单、低成本、容易冷启动;缺点是容易漏维度,粒度不稳定,也缺少区分好坏答案的对比信号。

对比生成
利用偏好对,比如 chosen answer 和 rejected answer,让模型总结“好答案比差答案强在哪里”。这种方法更有判别性,但可能过度绑定某一对样本,泛化性不足。

迭代优化
先生成 Rubric,再验证、拆解、去重、压缩。论文强调,高质量 Rubric 不只是“看起来像标准”,还要具备区分度、覆盖度、原子性、可验证性和低冗余。

在线/共演化生成
Rubric 不再是固定的,而是随着模型训练、rollout 和失败模式动态更新。原因是静态 Rubric 会逐渐失去区分力,也更容易被模型 reward hacking。

2. Rubric 怎么用于模型训练

Rubric 可以直接变成训练信号。

在 policy model training 中,Rubric 可以对最终答案或中间轨迹打分,再聚合成 reward,用 PPO、GRPO、DPO 等方法优化模型。对于 Agent 或推理模型,Rubric 不只评最终答案,也能评子目标完成、工具选择、执行正确性等中间过程。

论文还提到,简单把多项 Rubric 加权成一个标量分数可能太粗糙,容易 reward hacking。因此一些工作开始研究更复杂的 reward 设计,比如 veto 机制、非线性聚合、课程式权重调整、逐项优化等。

在 reward model training 中,Rubric 主要有三类作用:提升可解释性、提供更密集的 reward signal、帮助构造高质量训练数据。

3. Rubric 怎么用于模型评测

论文认为,Rubric 特别适合评开放式复杂任务,比如:

  • 数学推理:中间步骤是否有效,最终答案是否正确;

  • Deep Research:证据是否可靠,覆盖是否全面;

  • Tool-use Agent:工具选择是否正确,执行轨迹是否合理;

  • 代码生成:算法是否正确,错误处理是否鲁棒;

  • 多模态生成:实体放置是否准确,是否有视觉幻觉;

  • 医疗问答:是否安全,建议是否可执行。

这和你前面写的 Skill 评测非常相关:Rubric 不仅评 final output,也可以评 intermediate trajectory。

论文最重要的洞察

这篇综述的核心价值,不是告诉我们“Rubric 很有用”这么简单,而是给出了一个更工程化的理解:

Rubric 是把隐性质量标准显式化的接口。

以前我们经常说:

这个回答好不好?
这个 Agent 表现行不行?
这个 Skill 是否靠谱?

但如果没有 Rubric,这些判断往往是模糊的、主观的、不可复现的。Rubric 的作用就是把“好”拆成若干可观察标准,让评测结果变得可解释、可诊断、可比较,也能进一步变成训练信号。

局限与开放问题

论文最后也指出,Rubric 并不是银弹。它仍然面临几个关键问题:

  1. Reward hacking:模型可能学会迎合 Rubric 表面特征,而不是真正提升质量。

  2. 泛化问题:某个任务上有效的 Rubric,不一定能迁移到新任务。

  3. 评测偏差:Rubric 本身可能带有设计者偏见,Judge 也可能偏向某些表达风格。

  4. 个性化:不同用户、场景、领域对“好”的标准不同,Rubric 需要适配。

  5. 安全性:错误 Rubric 可能把模型优化到危险方向。

最后结论

这篇论文可以概括为一句话:

Rubric 是大模型从“凭感觉评好坏”走向“按标准评质量”的关键基础设施。

它让 LLM 评测更透明,让 reward 更可解释,让 Agent 过程评估更细粒度,也让复杂任务的质量标准可以被沉淀、复用和迭代。