Allen AI · 官方

MolmoMotion:语言引导的3D运动预测 | Ai2

MolmoMotion: Language-guided 3D motion forecasting | Ai2

二〇二六年六月十七日 · 英文原文

Allen AI 发布运动预测模型 MolmoMotion,基于 Molmo 2 骨干网络,输入视频帧、物体 3D 点与动作指令,预测未来 3D 点轨迹。同时发布最大配对数据集 MolmoMotion-1M(116 万视频)与人工验证基准 PointMotionBench(2700 片段)。MolmoMotion 在 PointMotionBench 上优于现有方法(如 ObjectForesight、Cosmos Predict),在机器人规划中闭环成功率 76.3%(对比 Molmo 2 的 56.0%),并提升视频生成的运动一致性。模型权重、数据集与基准均已开源。

机器已经变得非常擅长感知运动。给定一段视频,现代模型能够以极高的置信度追踪物体和点在场景中的移动方式。但感知本质上是回顾性的:它解释已经发生的运动。而我们想要构建的许多系统和应用需要的是向前看。一个伸手去拿杯子的机器人必须在触碰杯子之前就预判杯子将如何移动。一个视频生成器必须知道接下来什么样的运动是真实的,才能生成物理上合理的帧。

预测运动比观察运动更难,但在许多场景中也更有用。

这个想法是我们今天发布的运动预测新模型 MolmoMotion 背后的驱动力。给定一个视频帧、标记在物体上的 3D 点以及描述预期动作的书面指令(例如,“移动并旋转桌子上装有水果的木碗”),MolmoMotion 能预测这些点在接下来几秒内将在 3D 空间中移动到的位置——其性能显著优于现有的预测方法。

给定一个 RGB 观测、物体上的一组查询点以及一个动作描述,MolmoMotion 能预测该物体未来的 3D 点轨迹。这些预测轨迹随后可用于驱动下游应用,例如机器人规划和轨迹条件视频生成。

与模型一同发布的,还有 MolmoMotion-1M,这是目前最大的、与动作描述配对的 3D 点轨迹数据集,来源于 116 万个视频。我们还发布了 PointMotionBench,这是一个经过人工验证的基准测试,旨在衡量以物体为中心的 3D 运动预测精度,包含 2700 个视频片段。

我们发现,像 MolmoMotion 这样的运动预测器在从机器人规划到可控视频生成等一系列下游任务中都很有用。我们公开了模型权重、MolmoMotion-1M 数据集以及 PointMotionBench 基准测试,供社区研究、改进和定制。

MolmoMotion:内部机制

MolmoMotion 以一种精心设计且高效的方式表示运动:即世界坐标系中附着在物体上的 3D 点,这种方式无需渲染完整视频即可捕捉运动。我们选择它是因为我们需要一种具备三个特性的通用运动表示:

  1. 类别无关:不依赖于人体、手部、刚体或任何其他固定类别的模板。
  2. 视角稳定:相同的物理运动应在不同相机和视角下得到一致的表示。
  3. 下游系统可直接使用:这些系统需要对物理运动进行推理。

在我们考虑过的表示方法中,它是唯一满足所有三个条件的。一组稀疏的表面点可以描述刚性、铰接以及(在一定限度内)可变形运动,而无需假设被移动物体的类型。由于这些点位于共享的世界坐标系中,它们的轨迹在相机运动和视角变化下保持稳定。而且,由于它们是 3D 空间中紧凑的显式轨迹,可以直接传递给机器人策略或视频生成模型等系统。

为了预测这些轨迹,MolmoMotion 使用 Molmo 2 作为其骨干网络,使其能够将语言指令与图像中的物体和点关联起来。给定一段短视频历史、一个动作描述以及一组带有初始 3D 位置的查询点,模型首先识别出所指的物体、查询点以及指令描述的运动。然后,它预测每个点未来的 3D 轨迹。

我们训练了 MolmoMotion 的两个变体:

介绍 MolmoMotion-1M 和 PointMotionBench

为了训练 MolmoMotion,我们需要当时还不存在的数据:大规模视频,其中包含与特定物体关联的 3D 点轨迹,并与动作描述配对。现有的 3D 轨迹数据集规模小且领域受限,虽然互联网视频具有我们为 MolmoMotion 这样的预测器所需的所有规模和多样性,但它们不包含 3D 标注。因此,我们构建了一个自动流水线,从无约束视频中提取与物体关联的 3D 轨迹。

给定一个输入视频及其动作描述,我们的标注流水线会生成以公制世界坐标表示的、与物体关联的 3D 点轨迹。(下图展示了每个阶段。)挑战在于,来自无约束视频的原始轨迹充满噪声——深度和跟踪误差导致点抖动和漂移——而且物体在视频的大部分时间里往往保持静止。为了使数据更可靠,我们过滤掉那些不与物体其余部分一致移动的点,平滑剩余的轨迹,并将每个片段裁剪到物体实际移动的时间窗口。

大规模运行我们的流水线产生了 MolmoMotion-1M——据我们所知,这是迄今为止最大的、包含动作描述且与物体关联的 3D 点轨迹语料库,涵盖 736 种运动类型和 5600 个不同的物体。

我们的数据标注流水线概览。给定一个动作事件的视频及其描述,我们首先定位移动的物体并在其上采样查询点。然后,我们跟踪物体上的密集 2D 点,将这些轨迹提升到共享的公制 3D 坐标系中,并使用物体级别的空间和时间一致性先验来过滤不可靠的轨迹。最后,我们将视频裁剪到被定位物体发生有意义运动的时间区间附近。

左侧指令:"移动并旋转桌子上装有水果的木碗。" 右侧指令:"在蓝色布料上滚动粘毛滚筒。"

左侧指令:"一辆银色汽车沿着道路行驶并缓慢右转。" 右侧指令:"一只火烈鸟在向右行走时将喙浸入水中。"

为了评估 MolmoMotion 的预测性能,我们还构建了 PointMotionBench,这是一个经过人工验证的、包含保留 3D 轨迹的基准测试。它涵盖了 2700 个视频片段,涉及 111 个物体类别和 61 种运动类型,包括室内操作、以自我为中心的手物交互以及室外动态场景。对于每个片段,模型会获得当前观测、物体查询点以及一个动作描述,并根据其预测的 3D 点轨迹与物体实际未来运动的匹配精度进行评估。这为我们提供了一个直接的 3D 运动预测定量测试,而不是依赖于生成的轨迹看起来是否合理。

实验与性能

我们通过三种方式评估 MolmoMotion。首先,我们测试它是否比现有方法更准确地预测未来的 3D 运动。其次,我们测试它学到的运动知识是否能帮助机器人执行操作任务。第三,我们测试同样的知识是否能帮助引导生成视频中的运动。

3D 运动预测

在 PointMotionBench 上,MolmoMotion 在我们测试的所有现有 3D 运动预测方法中表现最佳——包括像素空间视频生成器、参数化 3D 方法以及一个简单的恒速基线——跨越了各种物体、场景和动作。

MolmoMotion 可以预测多种物体和场景的运动,例如粘毛滚筒如何在布料上来回滚动,碗如何在桌子上滑动和旋转,火烈鸟如何在向右行走时将喙浸入水中,或者汽车如何在转弯时沿着道路行驶。在每种情况下,预测的路径都遵循了提供给 MolmoMotion 的指令,并且与基准测试中的真实运动轨迹非常接近。

PointMotionBench 基准测试结果

条形图显示 PointMotionBench 上每个子集的 3D 平均位移误差(单位:米)。数值越低越好。

HOT3D
MolmoMotion-AR (3f)
ObjectForesight
MolmoMotion-FM (3f)
MolmoMotion-AR (1f)
外推基线
EgoScaler
静态基线
MolmoMotion-FM (1f)
Wan2.2-5B
Robot4DGen
Cosmos Predict
Track2Act
WorldTrack
MolmoMotion-AR (3f)
MolmoMotion-AR (1f)
MolmoMotion-FM (3f)
MolmoMotion-FM (1f)
静态基线
外推基线
Robot4DGen
Cosmos Predict
Wan2.2-5B
Track2Act
DAVIS
MolmoMotion-AR (1f)
MolmoMotion-AR (3f)
MolmoMotion-FM (1f)
MolmoMotion-FM (3f)
Robot4DGen
静态基线
外推基线
Wan2.2-5B
Cosmos Predict
Track2Act
来源:MolmoMotion 论文,表 1——PointMotionBench 上的 3D 点轨迹预测。MolmoMotion (3f) 和 (1f) 分别表示 3 帧和单帧输入变体。ObjectForesight 和 EgoScaler 仅在 HOT3D 上报告(表 1 其他部分)。静态基线保持每个 3D 点固定;外推基线从先前帧线性投影运动。
下游评估:机器人规划

MolmoMotion 学到的运动知识应该能够从一个场景迁移到另一个场景——用手拿起杯子和用机器人夹爪拿起杯子是非常不同的动作,但杯子本身在 3D 空间中遵循的路径是相似的。这使得 MolmoMotion 非常适合机器人领域,因为机器人在移动物体之前必须规划物体应如何移动。

在 DROID(一个大型的、包含真实世界机器人操作视频的开放数据集)上进行微调后,我们发现 MolmoMotion 能够针对各种机器人规划场景,在不同的物体、相机视角、场景和任务中预测出合理的物体路径。

左侧指令:"从容器中取出布料。" 右侧指令:"移动锅盖。"

在仿真中,基于 MolmoMotion 构建的控制策略在拾取和放置任务上的成功率为 76.3%,而基于 Molmo 2 的相同策略成功率为 56.0%——并且它学习得更快,在 10K 训练步后达到 51%,而 Molmo 2 版本最高仅为 19%。在真实机器人上(微调后),MolmoMotion 仅用约 2K 步就达到了 Molmo 2 基线需要 12K 训练步才能达到的测试 L2 误差。

MolmoMotion 改进了机器人规划

相同的 MolmoBot 策略,不同的骨干网络初始化。闭环成功率越高越好。

MolmoMotion 初始化 Molmo 2 初始化
样本效率
10K 步时的成功率 51.0 19.0
最终闭环成功率
已见场景 已见物体 85.0 70.0
已见场景 未见物体 74.5 51.2
未见场景 已见物体 72.0 50.0
未见场景 未见物体 74.2 48.7
平均 76.3 56.0
来源:MolmoMotion 论文,图 5a 和 5.2 节。两种 MolmoBot 策略使用相同的流匹配动作头和 20K 发布片段,仅在骨干网络初始化上有所不同。
下游评估:视频生成

指令:"一只火烈鸟在向右行走时将喙浸入水中。" 从左到右:DaS + MolmoMotion, CogVideoX-5B, 和 WAN-14B。

指令:"从桌子上拿起圆形的浅棕色盘子。" 从左到右:DaS + MolmoMotion, CogVideoX-5B, 和 WAN-14B。

MolmoMotion 预测的路径也可以引导视频生成。与其让图像到视频模型仅凭文本指令猜测运动,不如输入 MolmoMotion 的预测。结果是生成的视频能更紧密地遵循所请求的动作,尤其是对于提示只能模糊描述的小而精确的运动。

指标也支持这一点。用于引导视频生成器时,MolmoMotion 在我们测量的所有五个运动相关指标上均优于基础模型,并在五个指标中的四个上击败了更大的图像到视频模型。

MolmoMotion 引导的视频生成结果

DaS + MolmoMotion 在所有五个指标上均优于 CogVideoX-5B,并在五个指标中的四个上击败了更大的 Wan2.2-I2V-A14B。数值越高越好。

时间一致性
DaS + MolmoMotion
Wan2.2-I2V-A14B
CogVideoX-5B
主体一致性
DaS + MolmoMotion
Wan2.2-I2V-A14B
CogVideoX-5B
运动平滑度
DaS + MolmoMotion
CogVideoX-5B
Wan2.2-I2V-A14B
动态程度
Wan2.2-I2V-A14B
DaS + MolmoMotion
CogVideoX-5B
背景一致性
DaS + MolmoMotion
Wan2.2-I2V-A14B
CogVideoX-5B
来源:MolmoMotion 论文,表 2。本节中的条形长度在每个指标行内重新缩放,以使微小差异可见,不应解释为绝对分数比例;打印的分数是报告的值。

局限性与未来方向

MolmoMotion 是一个能力强大的模型,但仍有一些局限性需要注意。它在训练期间每个物体使用八个查询点——足以预测有用的轨迹,但不足以密集地表示表面几何形状。这限制了模型处理复杂可变形运动的能力。

我们认为,预测——在物体移动之前预判它们将如何移动——与感知已经存在的事物一样,是机器智能的基础。MolmoMotion 是朝着这个方向迈出的一步——一种无需类别模板即可跨物体类别泛化的 3D 运动预测,从普通视频中学习,并且是我们通过 PointMotionBench 测量到的最准确的 3D 运动预测器。我们预计在机器人、视频及其他领域将会有许多应用随之而来。

我们鼓励你通过下载权重检查训练数据以及根据 PointMotionBench 评估我们的方法来尝试 MolmoMotion。

加入我们

在 Ai2,我们正在构建透明、开源 AI 的未来——以开放的方式构建,以赋能科学进步和对这项改变世界的技术的基本理解。我们在此不是为了盈利,而是为了确保 AI 的益处被广泛分享并造福人类。如果你对此感兴趣,请查看我们的开放职位。

订阅以每月接收关于 Ai2 最新动态的更新。

译自 Allen AI · 官方 · 录于 二〇二六年六月十七日