【第676期】智能自动机学习:大语言模型智能体发现世界模型Seventy3

【第676期】智能自动机学习:大语言模型智能体发现世界模型

18分钟 ·
播放数1
·
评论数0

Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。

如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。

联系小助手微信:seventy3_podcast(加群/投稿论文)

今天的这篇的主题是:

Can LLM Agents Infer World Models? Evidence from Agentic Automata Learning

Summary

我们提出了“Agent 化的自动机学习”(agentic automata learning),用于评估工具调用型 LLM Agent 通过交互揭示隐藏环境的能力。

在我们的设定中,Agent 需通过与 Oracle(神谕/专家)进行两种交互来揭示一个隐藏的确定性有限状态自动机(DFA):(1)成员查询(“该字符串是否属于目标语言?”)以及(2)等价性查询(“这是目标 DFA 吗?”)。这提供了一个具有可控任务复杂度、可测量交互效率以及强基线(传统的自动机学习算法)的可扩展测试床。

对最先进的 LLM 进行评估后,我们发现其性能随着 DFA 规模的增大而急剧下降。推理模型(reasoning models)的表现显著强于非推理模型,但轨迹分析揭示了其在查询规划、证据整合和假设构建方面反复出现的失败。

总体而言,我们的结果表明,当前的 LLM Agent 有时能够完成非平凡的交互式探索,但该任务上的鲁棒性和效率仍远落后于传统算法。

原文链接:arxiv.org