【第696期】强化学习元认知反馈:大模型不确定性的忠实表达Seventy3

【第696期】强化学习元认知反馈:大模型不确定性的忠实表达

20分钟 ·
播放数0
·
评论数0

Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。

如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。

联系小助手微信:seventy3_podcast(加群/投稿论文)

今天的这篇的主题是:

Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs

Summary

元认知(Metacognition)是智能的核心组成部分,它描述了监控和调节自身认知过程的能力。然而,大语言模型(LLMs)在关键的元认知功能上展现出了系统性缺陷:它们以高度的自信产生幻觉、无法识别自身的知识边界,并歪曲其内部的不确定性——这严重削弱了模型的信任度与可靠性。

由于监控任务表现并据此调整行为是元认知能力的核心,我们假定:能够准确判断自身表现的模型,更有能力去提升这种表现。我们通过两种新颖的机制将这一思想付诸实践:

  1. 元认知反馈强化学习(RLMF):一种在偏好优化过程中,基于模型对自身表现自我判定的质量,来精炼补全结果(completion)排序的范式;

  2. 元认知数据选择:利用类似的自我判定来识别高价值训练样本,其效果超越了朴素的主动学习(naive active learning)。

我们将这些创新应用到忠实对齐校准(Faithful Calibration, FC)问题上,该任务本身就具备根本上的元认知属性:其目标是将表达出的不确定性与内在的不确定性保持一致,这即使对于前沿 LLM 而言也极具挑战。我们采用了解耦的两阶段方法:首先利用这些方法来校准模型自我报告的自信度得分的忠实度;随后通过有针对性的输出编辑,将其映射为自然且能适应上下文的语言学不确定性表达。

广泛的实验表明,RLMF 在保持准确率的同时,在多样化的任务上实现了具备泛化能力且达到 SOTA 水平的忠实对齐校准(FC)。此外,RLMF 的表现超越了标准强化学习(RL)高达 63%,同时增强了模型评估和表达自身能力边界的能力。这使得 RLMF 成为了一种极具前景的范式,能够提升 LLM 的元认知能力,进而推动能力与对齐(alignment)的改善;同时也表明元认知表现可以作为一种有效的强化学习信号,用以克服先前内在反馈方法的局限性。

原文链接:arxiv.org