大语言模型生成能力突飞猛进,但验证能力却成了短板——传统打分把丰富信息压成几个离散值,导致好答案坏答案挤成一团。这篇论文提出LLM as a verifier框架,巧妙利用评分token的完整分布计算连续分数,让评分粒度更细、结果更稳、标准更可拆。在代码、机器人、医疗等测试中达到SOTA,还能充当强化学习的密集奖励信号。
原文:arxiv.org

大语言模型生成能力突飞猛进,但验证能力却成了短板——传统打分把丰富信息压成几个离散值,导致好答案坏答案挤成一团。这篇论文提出LLM as a verifier框架,巧妙利用评分token的完整分布计算连续分数,让评分粒度更细、结果更稳、标准更可拆。在代码、机器人、医疗等测试中达到SOTA,还能充当强化学习的密集奖励信号。
原文:arxiv.org