Microsoft Research · 学术

MindTopo揭示VLM空间推理能力

MindTopo reveals VLMs’ spatial reasoning abilities

二〇二六年八月十二日 · 英文原文

微软研究院发布MindTopo基准,用于评估多模态大语言模型的3D拓扑推理与规划能力,涵盖连续性、分离性、顺序、包含性和打结性五类任务。测试显示,模型在静态图像识别上表现优于交互规划,后者常因无法跨动作维持拓扑关系而失败。该基准由受控模拟器生成,提供精确标签,旨在诊断感知与规划阶段的差异,为机器人及交互环境AI系统提供参考。

一眼看去,MindTopo 是一个用于测试 AI 拓扑推理能力的新基准,评估多模态模型能否理解连通性、包含、顺序、分离和打结等概念。该基准同时衡量推理和规划能力,不仅测试模型能否在静态图像中识别拓扑关系,还测试它们能否通过一系列动作保持并操作这些关系。当前多模态模型在静态识别上的表现远优于交互任务,这表明它们在随时间维持一致的拓扑理解方面存在困难。失败往往出现在规划阶段而非感知阶段,模型在场景变化时丢失结构关系,或提出违反物理约束的动作。这些发现凸显了一个重要机遇,即推进面向机器人和交互环境的 AI 系统,在这些场景中,理解什么保持连接、包含、有序或打结对于可靠决策至关重要。

AI 能否判断添加一堵墙后两个房间是否仍然连通?能否识别动物是否在围栏内,区分真正的绳结与缠绕的环,或在不让绳索相互穿过的情况下重新排列多根绳索?这些问题涉及 3D 拓扑,这是一种空间理解形式,不基于精确的距离、角度或形状,而是基于物体弯曲、拉伸或变形时持续存在的结构关系。连通性、包含、顺序和打结性都是拓扑属性的例子。在认知科学中,这些属性是人类空间理解的基础层,但在多模态 AI 系统的评估中却基本缺失。在一项新研究中,我们引入了 MindTopo(在新标签页中打开),这是一个旨在评估多模态大语言模型是否具备这种拓扑直觉的基准。我们的发现揭示了在静态图像中识别拓扑与在规划和行动时维持对该拓扑的直觉理解之间存在显著差距。当前模型有时能在单一场景中识别连通路径、封闭区域或绳结,但一旦模型必须通过一系列动作操作场景,这种理解往往就会崩溃。

MindTopo 如何定义拓扑空间

大多数多模态模型的空间评估聚焦于欧几里得属性,如距离、方向、大小和相对位置。受 Piaget 及其他认知文献对拓扑能力分类的启发,MindTopo 将任务组织为以下五个类别:

每个类别在两个认知层面进行评估。在推理任务中,模型检查一个或多个渲染场景,并回答关于其拓扑结构的问题:迷宫中的两点是否连通,羊是否在围栏内,绳索是否真正打结。在规划任务中,模型与模拟环境交互,并选择必须创建、保持或移除特定关系的动作,例如旋转管道段、绘制分离路径、重新排列积木、困住移动代理或解开绳索。环境强制执行合法动作,因此模型无法通过让一股绳穿过另一股来解决绳索谜题。

图 1. MindTopo 将静态场景问题与要求模型保持或改变相同拓扑关系的交互任务配对。所有场景均由受控模拟器生成,提供精确的真实标签和可调难度。这种控制使得区分两种看似相似的失败模式成为可能:一种是因为场景视觉复杂而失败的模型,另一种是因为物体移动时无法维持底层关系而失败的模型。

图 2. MindTopo 将推理和规划任务映射到连续性、分离性、顺序、包含性和打结性。

看到拓扑不等于作用于拓扑

在一系列专有和开放权重模型中,静态推理的表现始终强于交互规划,且两者都远低于人类水平。当成功依赖于跨多个动作保持关系时,对比尤为明显。错误模式有助于定位问题。静态错误通常始于感知,例如遗漏墙壁、开口或交叉点。规划错误则出现在场景被理解之后。模型遵循局部看似合理的移动而不追踪其后续后果,在多轮中丢失任务,或提出违反环境动态的动作。

Azure AI Foundry Labs 通过微软研究院的这些实验性技术,一窥 AI 未来可能的发展方向。 Azure AI Foundry(在新标签页中打开)

生成工具揭示了什么

我们还测试了图像和视频生成是否能帮助模型维持对拓扑关系的理解。当相关关系在单帧中可见时,图像生成有时有帮助,但在跨序列的交叉或移动中仍不可靠。视频推演经常改变拓扑或违反任务动态。视觉模拟似乎仅在随时间保持结构约束时才有用。

构建保持结构的代理

MindTopo 旨在作为这一差距的受控诊断工具。机器人、无障碍工具和交互助手不仅需要理解物体在哪里,还需要理解随着动作展开,什么保持连接、包含、有序或打结。缩小这一差距可能需要携带显式拓扑状态的模型,或通过构造保持拓扑的世界模型。

(在新标签页中打开)

帖子《MindTopo 揭示 VLM 的空间推理能力》首次出现在微软研究院。

译自 Microsoft Research · 学术 · 录于 二〇二六年八月十二日