【第738期】Rehearse:跨越自动研究中的信心悬崖Seventy3

【第738期】Rehearse:跨越自动研究中的信心悬崖

25分钟 ·
播放数1
·
评论数0

今天的这篇的主题是: Rehearse: Stepping Back from the Confidence Cliff in Self-Improving Autoresearch

Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。

如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。

联系小助手微信:eccstartup(加群/投稿论文)

Summary

自动研究(Autoresearch)通过提议修改、运行完整的训练任务以及保留能提升指标的修改,来改进机器学习代码。这一循环的效率不仅取决于产生构想,还取决于智能体在消耗一次训练运行之前,判断某项提议修改是否可能奏效的能力。我们研究了这种执行前判断(pre-execution judgment)的可靠性在自动研究轨迹的发展过程中是如何变化的。在公开的 AutoSOTA 日志(Li et al., 2026; Tsinghua FIB Lab, 2026)中,有益修改的比例从前两轮迭代中的 70% 下降到了第 6 轮及以后的 43%。在来自 39 个源自论文的 AutoSOTA 任务的 296 对同基线修改对(每对包含一个提升了指标的修改和一个未提升的修改,且隐去了实际测得的结果)中,一个在获得候选推理过程(rationales)但未获得先前尝试历史的情况下,给出严格共识裁决的 LLM 裁判准确率达到了 79.5%。然而,在包含 366 个修改对的完整基准测试中,这种能力在循环的后期大幅削弱。随着成功修改的累积,选择性准确率(selective accuracy,即以严格共识裁决为条件的准确率)从 82.8% 降至 56.9%,而裁判依然倾向于做出裁决。我们将这种运行模式称为置信度悬崖(confidence cliff)。《Rehearse》将这种循环改进实现为一种用于自动研究循环的轻量级技能:提议多个构想,在执行前对其进行比较,运行最富前景的构想,并结合针对类似过往尝试与结果的专注记忆进行裁判。这种专注的结果记忆将后期的选择性准确率提升至 83.5%。在跨越三个循环、包含 4,000 个预算内训练运行的测试中,在相同的训练运行预算下,《Rehearse》提升了 nanochat、图像分类和时间序列预测任务的终点性能。

原文链接:arxiv.org