Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。
如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。
联系小助手微信:seventy3_podcast(加群/投稿论文)
今天的这篇的主题是:
SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning
Summary
空间推理(即确定物体位置、相互关系以及在三维空间中如何运动的能力)依然是视觉语言模型(VLM)面临的一项根本性挑战。工具增强型 Agent 试图通过为 VLM 补强专业感知模块来解决这一问题,但其有效性受到调用这些工具的动作接口(action interface)的限制。
在本文中,我们研究了该接口的设计如何塑造 Agent 进行开放式空间推理的能力。现有的空间 Agent 要么采用单次代码执行,这种方式在观察到任何中间结果之前就已确定了完整的分析策略;要么依赖结构化的工具调用接口,这往往缺乏自由组合操作或针对具体任务量身定制分析的灵活性。这两种设计对于开放式、复杂的 3D/4D 空间推理所提供的灵活性都非常有限。
因此,我们提出了 SpatialClaw,这是一个采用代码作为动作接口的无需训练的空间推理框架。SpatialClaw 维持一个有状态的 Python 内核,其中预载了输入帧以及一系列感知和几何图元,允许由 VLM 支持的 Agent 在每一步根据所有先前的输出来编写一个可执行单元格,从而使 Agent 能够灵活地组合与操作感知结果,并根据中间的文本、视觉观察以及每个问题的需求来调整其分析过程。
在跨越广泛静态与动态 3D/4D 空间推理任务的 20 个空间推理基准测试上的评估表明,SpatialClaw 实现了 59.9% 的平均准确率,超越了近期的空间 Agent +11.2 个百分点;且在来自两个模型家族的六个 VLM 底座上均实现了持续的性能提升,期间无需任何针对基准测试或特定模型的微调适配。
原文链接:arxiv.org

