Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。
如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。
联系小助手微信:seventy3_podcast(加群/投稿论文)
今天的这篇的主题是:
Agents’ Last Exam
Summary
近期的人工智能系统在一系列广泛的基准测试中取得了优异的成绩,然而这些进步并未能在众多专业领域中转化为具备经济意义的落地应用。我们认为,这一差距很大程度上源于评估环节的问题:目前被广泛使用的基准测试缺乏对真实且具备经济价值的工作流程进行持续性的性能测量。
本文介绍了“Agent 的终极考场”(Agents' Last Exam, 简称 ALE),这是一个旨在评估 AI Agent 在具有可验证结果、长流程、具备经济价值且贴近现实世界任务中表现的基准测试。ALE 是与 250 多位行业专家合作开发的,其覆盖的非物理产业均参考了 O*NET / SOC 2018(美国联邦职业分类体系)进行定义。它围绕一个包含 55 个子领域、归类为 13 个行业集群的任务分类体系展开,涵盖 1000 多个任务。
目前的结果表明,最难的梯队距离“饱和”还差得远:在主流的框架(harness)和骨干模型(backbone)配置下,平均完全通过率低于 1%。ALE 被设计为一个动态发展的基准测试:随着新工作流程和新行业的不断加入,其任务池将持续扩大。更广泛地说,ALE 的定位不仅是另一个排行榜,更是缩小基准测试的成功与对国内生产总值(GDP)产生实际影响之间差距的工具。
原文链接:arxiv.org

