SpatialClaw:重新思考具身空间推理的动作接口
SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning
来自 NVIDIA
摘要
空间推理——即判断物体在三维空间中的位置、相互关系及运动方式的能力——仍是视觉语言模型(VLM)面临的根本性挑战。工具增强型智能体试图通过为VLM配备专业感知模块来解决这一问题,但其有效性受限于调用这些工具的动作接口。本研究探讨了该接口的设计如何影响智能体在开放式空间推理中的能力。现有空间智能体要么采用单次代码执行,在观察到任何中间结果之前就确定完整的分析策略;要么依赖结构化的工具调用接口,这种接口在自由组合操作或针对任务定制分析方面往往灵活性不足。这两种设计对开放式的复杂3D/4D空间推理都缺乏足够的灵活性。为此,我们提出SpatialClaw——一种无需训练的空间推理框架,采用代码作为动作接口。SpatialClaw维护一个带状态的Python内核,预加载输入帧及一套感知与几何基元,使基于VLM的智能体能够根据所有先前输出,每步编写一个可执行单元,从而灵活组合和操作感知结果,并根据中间文本与视觉观察以及每个问题的具体需求调整分析策略。在涵盖广泛静态与动态3D/4D空间推理任务的20个空间推理基准上,SpatialClaw取得了59.9%的平均准确率,比最新的空间智能体高出11.2个百分点,并在两个模型家族的六个VLM骨干网络上均实现了一致性提升,且无需针对任何基准或模型进行专门适配。
译自 Hugging Face · Daily Papers · arXiv:2606.13673 · 录于 二〇二六年六月十二日