【第661期】AUTOLAB:前沿模型长程自动研发能力评测Seventy3

【第661期】AUTOLAB:前沿模型长程自动研发能力评测

24分钟 ·
播放数8
·
评论数0

Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。

如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。

联系小助手微信:seventy3_podcast(加群/投稿论文)

今天的这篇的主题是:

AUTOLAB: Can Frontier Models Solve Long-Horizon Auto Research and Engineering Tasks?

Summary

科学研究和工程创新本质上都是一个长时程(long-horizon)的迭代优化过程:不断提出改进方案、开展实验、测量结果,并持续优化已有成果。然而,目前针对前沿大语言模型的基准测试主要关注单轮回答(single-turn responses)或短时程智能体轨迹(short-horizon agent trajectories),无法充分评估智能体在长时间尺度上持续迭代改进所面临的挑战。

为弥补这一空白,我们提出 AutoLab——一个面向**超长时程闭环优化(ultra long-horizon closed-loop optimization)**的新型基准测试。

AutoLab 包含 36 个由领域专家设计的真实任务,覆盖四类具有代表性的应用场景:

  • 系统优化(system optimization)

  • 谜题与挑战(puzzle & challenge)

  • 模型开发(model development)

  • CUDA Kernel 优化(CUDA kernel optimization)

每个任务都提供一个**功能正确但刻意设计得性能欠佳(correct but deliberately suboptimal)的初始版本,并要求智能体在严格限定的墙钟时间(wall-clock time)**预算内不断改进该方案。

我们对 17 个当前最先进的大语言模型进行了评测。实验结果表明,决定最终成功与否的最关键因素,并不是智能体第一次尝试的质量,而是在整个优化过程中持续进行基准测试(benchmarking)、修改方案(editing)以及根据实验反馈不断迭代(incorporating empirical feedback)的能力。

具体而言:

  • Claude Opus 4.6 展现出了较强的长时程优化能力,能够持续推进任务并不断改进结果;

  • 而大多数前沿模型(包括多个闭源商业模型)则表现出明显不足,要么过早停止优化(terminate prematurely),要么在几乎没有取得有效进展的情况下耗尽全部时间预算。

这些实验结果进一步说明,对于自主智能体而言,**时间意识(time awareness)以及持续迭代优化(persistent iteration)**是实现长期自主工作的关键能力,而不仅仅是生成一次高质量的初始解。

为了促进这一方向的发展,我们将 AutoLab 的完整内容全部开源,包括:

  • 基准任务(benchmark);

  • 评测 Harness(evaluation harness);

  • 全部任务相关工件(task artifacts)。

希望借此推动能够真正胜任长时程自主优化任务的智能体研究。

原文链接:arxiv.org