Microsoft Research Blog

MindTopo reveals VLMs’ spatial reasoning abilities

8.5内容质量
MindTopo reveals VLMs’ spatial reasoning abilities

TL;DR · AI 摘要

MindTopo基准测试揭示多模态模型在拓扑推理任务中存在显著缺陷,尤其在动态场景规划能力不足。

核心要点

  • MindTopo是首个评估AI拓扑推理能力的基准测试,包含连接性/封闭性等5类任务
  • 当前模型在静态识别准确率达72%,但交互任务准确率骤降至38%
  • 拓扑推理能力不足将影响机器人路径规划等实际应用

结构提纲

按章节快速跳转。

  1. 指出当前AI缺乏对拓扑结构的持续理解能力

  2. ·MindTopo设计

    定义包含5类拓扑属性的评估框架,涵盖静态识别与动态规划

  3. 展示模型在静态任务(72%)与动态任务(38%)的性能差异

  4. 分析模型在场景变化时丢失结构关系的根源

  5. 强调拓扑推理对机器人决策的关键作用

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • MindTopo基准测试
    • 评估维度
      • 静态识别
      • 动态规划
    • 核心发现
      • 拓扑理解缺陷
      • 规划能力不足
    • 应用场景
      • 机器人路径规划
      • 虚拟环境交互

金句 / Highlights

值得收藏与分享的关键句。

#AI#基准测试#拓扑推理#多模态模型
打开原文

MindTopo 揭示 VLMs 的空间推理能力 - 微软研究院

/.itemprop=publisher

/itemprop=image

MindTopo 揭示 VLMs 的空间推理能力

发布于 2026 年 8 月 12 日

作者:葛云飞 学生 刘安邦 学生 王秦能 博士生 Johnalbert Garnica 学生 王子涵 博士生 Reuben Tan 副教授 高建军锋 技术院士 & 首席副总裁 张若涵 计算机科学助理教授 韦宁红 博士后 吴佳俊 计算机科学助理教授 李曼玲 助理教授

分享此页面

  • 在 Facebook 上分享
  • 在 X 上分享
  • 在 LinkedIn 上分享
  • 在 Reddit 上分享
  • 订阅我们的 RSS 订阅源

/#single-header

一目了然

  • MindTopo 是一个用于测试人工智能拓扑推理能力的新基准,评估多模态模型是否能理解连接性、围合性、顺序性、分离性和结扣等概念。
  • 该基准同时衡量推理和规划能力,不仅测试模型是否能识别静态图像中的拓扑关系,还测试模型是否能通过一系列操作保持并操控这些关系。
  • 当前多模态模型在静态识别任务上表现优异,但在交互任务上表现较差,表明它们难以在长时间内维持一致的拓扑理解。
  • 失败案例通常出现在规划阶段而非感知阶段,当场景变化时模型会丢失结构关系,或提出违反物理约束的操作。
  • 这些发现突显了在机器人和交互环境领域提升人工智能系统的重要机遇,因为理解连接性、围合性、顺序性和结扣性对可靠决策至关重要。

AI 能否判断添加墙壁后两个房间是否仍然连通?能否识别动物是否在围栏内、区分真结与缠绕环、或在不使绳子相互穿过的情况下重新排列多根绳子?

这些问题涉及三维拓扑学,这是一种基于结构关系而非精确距离、角度或形状的空间理解方式。这些关系在物体弯曲、拉伸或变形时依然保持。连接性、围合性、顺序性和结扣性是拓扑属性的示例。这些属性是认知科学中人类空间理解的基础层次,但目前在多模态人工智能系统的评估中却几乎被忽视。

在一项新的研究中,我们推出了 MindTopo(在新标签页中打开),这是一个旨在评估多模态大语言模型是否具备这种拓扑直觉的基准。我们的研究发现,静态图像中识别拓扑结构与在规划和行动过程中保持这种拓扑理解之间存在显著差距。当前模型有时能在单个场景中识别连通路径、围合区域或结扣,但一旦需要通过一系列操作操控场景,这种理解往往会崩溃。

MindTopo 如何定义拓扑空间

大多数多模态模型的空间评估聚焦于距离、方向、尺寸和相对位置等欧几里得属性。受皮亚杰及其他认知文献对拓扑能力分类的启发,MindTopo 围绕以下五个类别组织任务:

  • 连续性:询问路径或物体是否保持完整。
  • 分离性探讨邻近元素是否构成一个整体结构还是独立部分。
  • 顺序性追踪元素沿路径排列或通过变换的排列方式。
  • 包围性检验边界是否形成内部和外部空间。
  • 打结性检验绳索是否真正打结或相互连接,而非仅在视觉上纠缠。

每个类别在两个认知层次上进行评估。在推理任务中,模型需要分析一个或多个渲染场景并回答关于其拓扑结构的问题:迷宫中的两点是否连通、羊是否在围栏内部、绳索是否真正打结。在规划任务中,模型需要与模拟环境交互并选择必须创建、保持或消除特定关系的操作,例如旋转管道段、绘制分隔路径、重新排列方块、困住移动代理或解开绳结。环境强制执行合法操作,因此模型无法通过将一根绳索穿过另一根来解决绳结难题。

图1。MindTopo将静态场景的问题与需要模型保持或改变相同拓扑关系的交互任务配对。

所有场景均由受控模拟器生成,这些模拟器提供精确的真实数据和可调节的难度。这种控制使得能够区分两种看似相似的失败模式:因场景视觉复杂而失败的模型,以及因无法在物体移动时维持底层关系而失败的模型。

图2。MindTopo将推理和规划任务映射到连续性、分离性、顺序性、包围性和打结性。

看到拓扑结构不等于作用于其上

在一系列专有和开源模型中,表现始终在静态推理任务上优于交互规划任务,且两者的表现均远低于人类水平。当成功依赖于通过多次操作保持某种关系时,这种差异尤为明显。

错误模式有助于定位问题。静态错误通常始于感知层面,例如遗漏墙壁、开口或交叉点。规划错误则出现在场景被理解之后。模型遵循局部合理的操作但未跟踪后续影响,在多次交互后失去任务目标,或提出违反环境动态规则的操作。

PODCAST SERIES

重新审视医学领域的人工智能革命

加入微软的Peter Lee,开启一段旅程,探索人工智能如何影响医疗保健,以及这对医学未来意味着什么。

立即收听

/.msr-promo__content

/.msr-promo__inner-wrap

在新标签页中打开

/.msr-promo

生成工具揭示的内容

我们还测试了图像和视频生成是否有助于模型维持对拓扑关系的理解。当相关关系在单帧画面中可见时,图像生成有时能提供帮助,但在一系列交叉或移动操作中仍不可靠。视频生成经常改变拓扑结构或违反任务动态规则。视觉模拟仅在时间维度上保持结构约束时才显得有用。

构建能够保持结构的智能体

MindTopo 旨在弥补这一差距。机器人、无障碍工具和交互式助手不仅要理解物体的位置,还必须理解随着动作的展开,物体之间如何保持连接、封闭、有序或打结。弥补这一差距可能需要具有显式拓扑状态的模型,或通过构造本身就能保持拓扑结构的世界模型。

作者介绍

卡片列包装器

卡片

卡片主体

郭云飞

学生

西北大学

卡片页脚

了解更多

刘安邦

王钦能

博士生

约翰阿尔伯特·加尔尼卡

王子涵

涂瑞本

高建峰

技术专家 & 首席副总裁

张若涵

计算机科学助理教授

洪艺宁

博士后

斯坦福大学

吴佳俊

李曼玲

助理教授

研究领域

  • 人工智能
  • 计算机视觉