Hugging Face · 官方博客

MolmoMotion:语言引导的3D运动预测

MolmoMotion: Language-guided 3D motion forecasting

二〇二六年六月十七日 · 英文原文

Allen AI 发布 MolmoMotion,一种基于 Molmo 2 backbone 的 3D 运动预测模型,能根据视频帧、物体 3D 点及动作指令预测未来轨迹。同时发布 MolmoMotion-1M 数据集(116 万视频)和 PointMotionBench 基准(2700 片段)。MolmoMotion 在 PointMotionBench 上优于现有方法,在机器人规划任务中成功率 76.3%,并提升视频生成运动质量。模型权重、数据集和代码已开源。

](https://huggingface.co/Ai2Comms)

🧠 模型:https://huggingface.co/collections/allenai/molmomotion | 📄 技术报告:https://allenai.org/papers/molmomotion | 📊 数据:https://huggingface.co/datasets/allenai/molmo-motion-1m | 💻 代码:https://github.com/allenai/molmo-motion.git | 🌐 项目页面:https://molmomotion.github.io/

机器在感知运动方面已经变得非常出色。给定一段视频,现代模型能够以极高的置信度追踪物体和点在场景中的移动方式。但感知本质上是回顾性的:它解释已经发生的运动。我们想要构建的许多系统和应用需要的是向前看。一个伸手去拿杯子的机器人,必须在接触杯子之前就预判杯子将如何移动。一个视频生成器,如果要生成物理上合理的帧,就必须知道接下来会发生什么样的真实运动。

预测运动比观察运动更难,但在许多场景中也更有用。

这个想法正是我们今天发布的运动预测新模型 MolmoMotion 背后的动机。给定一个视频帧、标记在物体上的 3D 点以及描述预期动作的书面指令(例如,“移动并旋转桌上装有水果的木碗”),MolmoMotion 能预测这些点在接下来几秒内将在 3D 空间中移动到的位置——其性能显著优于现有的预测方法。

视频 26 给定 RGB 观测、物体上的一组查询点以及动作描述,MolmoMotion 能预测该物体未来的 3D 点轨迹。这些预测轨迹随后可驱动下游应用,如机器人规划和轨迹条件视频生成。

与模型一同发布的还有 MolmoMotion-1M,这是迄今为止最大的、与动作描述配对的 3D 点轨迹数据集,源自 116 万个视频。我们还发布了 PointMotionBench,这是一个经过人工验证的基准测试,旨在衡量以物体为中心的 3D 运动预测精度,包含 2700 个视频片段。

我们发现,像 MolmoMotion 这样的运动预测器在从机器人规划到可控视频生成等一系列下游任务中都很有用。我们公开了模型权重、MolmoMotion-1M 数据集以及 PointMotionBench 基准测试,供社区研究、改进和定制。

MolmoMotion:技术内幕

MolmoMotion 以一种精心设计且高效的方式表示运动:即世界空间中附着在物体上的 3D 点,这种方式无需渲染完整视频即可捕捉运动。我们选择它是因为我们需要一种具有以下三个特性的通用运动表示:

  1. 类别无关:不依赖于人体、手部、刚体或任何其他固定类别的模板。
  2. 视角稳定:相同的物理运动应在不同相机和视角下得到一致的表示。
  3. 可被需要推理物理运动的下游系统直接使用。

在我们考虑过的表示方法中,它是唯一满足所有三个条件的。一组稀疏的表面点可以描述刚性、铰接以及(在一定限度内的)可变形运动,而无需假设被移动物体的类型。由于这些点位于共享的世界坐标系中,它们的轨迹在相机运动和视角变化下保持稳定。而且,由于它们是 3D 空间中紧凑的显式轨迹,可以直接传递给机器人策略或视频生成模型等系统。

为了预测这些轨迹,MolmoMotion 使用 Molmo 2 作为其 backbone,使其能够将语言指令与图像中的物体和点关联起来。给定一段短视频历史、一个动作描述以及一组带有初始 3D 位置的查询点,模型首先识别出所指的物体、查询点以及指令描述的运动。然后,它预测每个点未来的 3D 轨迹。

我们训练了 MolmoMotion 的两个变体:

Image 2: model_arc (1)

MolmoMotion 架构。Molmo 2 backbone 的共享输入包括 RGB 观测的图像 token、动作描述的文本 token,以及从 Molmo 2 视觉编码器采样的 2D 查询点特征 token。MolmoMotion-AR 将初始 3D 查询坐标编码,并将未来轨迹解码为量化的坐标文本,而 MolmoMotion-FM 则直接在连续 3D 坐标空间中表示它们。

介绍 MolmoMotion-1M 和 PointMotionBench

为了训练 MolmoMotion,我们需要当时还不存在的数据:大规模视频,其中包含锚定到特定物体并与动作描述配对的 3D 点轨迹。现有的 3D 轨迹数据集规模小且领域受限,虽然互联网视频具有我们想要的规模和多样性来训练像 MolmoMotion 这样的预测器,但它们不包含 3D 标注。因此,我们构建了一个自动化的 pipeline,从无约束视频中提取锚定物体的 3D 轨迹。

给定一个输入视频及其动作描述,我们的标注 pipeline 会生成以公制世界坐标表示的、锚定物体的 3D 点轨迹。(下图展示了每个阶段。)具有挑战性的是,来自无约束视频的原始轨迹是有噪声的——深度和追踪误差导致点出现抖动和漂移——而且物体在视频的大部分时间里通常是静止的。为了使数据更可靠,我们过滤掉那些不与物体其余部分一致移动的点,平滑剩余的轨迹,并将每个片段裁剪到物体实际移动的时间窗口。

大规模运行我们的 pipeline 产生了 MolmoMotion-1M——据我们所知,这是迄今为止最大的、包含动作描述且锚定物体的 3D 点轨迹语料库,涵盖 736 种运动类型和 5600 个不同的物体。

视频 27 我们的数据标注 pipeline 概览。给定一个动作事件的视频及其描述,我们首先定位移动的物体并在其上采样查询点。然后,我们在物体上追踪密集的 2D 点,将这些轨迹提升到共享的公制 3D 坐标系中,并利用物体级别的空间和时间一致性先验来过滤不可靠的轨迹。最后,我们将视频裁剪到锚定物体发生有意义运动的时间区间附近。

顶部指令:"移动并旋转桌上装有水果的木碗。" 底部指令:"在蓝色布料上滚动粘毛滚筒。"

顶部指令:"一辆银色汽车沿着道路行驶并缓慢右转。" 底部指令:"一只火烈鸟向右行走时将喙浸入水中。"

为了评估 MolmoMotion 的预测性能,我们还构建了 PointMotionBench,这是一个经过人工验证的、包含保留 3D 轨迹的基准测试。它涵盖 2700 个视频片段,涉及 111 个物体类别和 61 种运动类型,包括室内操作、第一人称视角的手物交互以及室外动态场景。对于每个片段,模型会获得当前观测、物体查询点以及动作描述,并根据其预测的 3D 点轨迹与物体实际未来运动的匹配精度进行评估。这为我们提供了一个直接的 3D 运动预测定量测试,而不是依赖于生成的轨迹看起来是否合理。

实验与性能

我们从三个方面评估 MolmoMotion。首先,我们测试它是否比现有方法更准确地预测未来的 3D 运动。其次,我们测试它学到的运动知识是否有助于机器人执行操作任务。第三,我们测试同样的知识是否有助于引导生成视频中的运动。

3D 运动预测

在 PointMotionBench 上,MolmoMotion 在所有我们测试过的现有 3D 运动预测方法中表现最佳——包括像素空间视频生成器、参数化 3D 方法以及简单的匀速基线——跨越了多种物体、场景和动作。

MolmoMotion 可以预测多种物体和场景的运动,例如粘毛滚筒如何在布料上来回移动,碗如何在桌子上滑动和旋转,火烈鸟如何向右行走同时将喙浸入水中,或者汽车如何沿着道路转弯。在每种情况下,预测的路径都遵循了提供给 MolmoMotion 的指令,并且与基准测试中的真实运动轨迹非常接近。

Image 3: precision-capture-2026-06-08T04-51-19--1of3-pointmotionbench-benchmark-results

下游评估:机器人规划

MolmoMotion 学到的运动知识应该能够从一个场景迁移到另一个场景——用人类的手拿起杯子和用机器人夹爪拿起杯子是非常不同的动作,但杯子本身在 3D 空间中遵循的路径是相似的。这使得 MolmoMotion 非常适合机器人领域,因为机器人在移动物体之前必须规划物体应该如何移动。

在 DROID(一个大型的、包含真实世界机器人操作视频的开放数据集)上进行微调后,我们发现 MolmoMotion 能够针对广泛的机器人规划场景,预测不同物体、相机视角、场景和任务下的合理物体路径。

视频 28视频 29 顶部指令:"将布料从容器中取出。" 底部指令:"移动锅盖。"

在仿真环境中,基于 MolmoMotion 构建的控制策略在拾取与放置任务上的成功率为 76.3%,而基于 Molmo 2 的相同策略成功率为 56.0%——并且它学习得更快,在 10K 训练步后达到 51%,而 Molmo 2 版本的最高水平仅为 19%。在真实机器人上(微调后),MolmoMotion 仅需约 2K 训练步就能达到 Molmo 2 基线在 12K 训练步后实现的测试 L2 误差。

Image 4: unnamed - 2026-06-05T152016.702

下游评估:视频生成

视频 30视频 31视频 32 指令:"一只火烈鸟向右行走时将喙浸入水中。" 从上到下:DaS + MolmoMotion, CogVideoX-5B, WAN-14B。

视频 33视频 34视频 35 指令:"从桌子上拿起圆形的浅棕色盘子。" 从上到下:DaS + MolmoMotion, CogVideoX-5B, WAN-14B。

MolmoMotion 预测的路径也可以引导视频生成。与其让图像到视频模型仅凭文本指令猜测运动,不如将 MolmoMotion 的预测结果输入进去。这样生成的视频能更紧密地遵循所请求的动作,尤其是对于提示词只能模糊描述的微小和精确动作。

指标也支持这一点。用于引导视频生成器时,MolmoMotion 在我们测量的所有五个与运动相关的指标上均提升了基础模型的运动质量,并且在五个指标中的四个上击败了一个更大的图像到视频模型。

Image 5: unnamed - 2026-06-05T152020.572

局限性与未来方向

MolmoMotion 是一个能力很强的模型,但仍有一些局限性需要注意。它在训练时每个物体使用八个查询点——这足以预测有用的轨迹,但不足以密集地表示表面几何形状。这限制了模型处理复杂可变形运动的能力。

我们认为,预测——在物体移动之前预判它们将如何移动——与感知已经存在的事物一样,是机器智能的基础。MolmoMotion 是朝着这个方向迈出的一步——一种无需每个类别模板即可跨物体类别泛化的 3D 运动预测,从普通视频中学习,并且是我们在 PointMotionBench 上测量过的最准确的 3D 运动预测器。我们预计在机器人、视频及其他领域将出现许多应用。

我们鼓励你通过下载权重检查训练数据以及在 PointMotionBench 上评估我们的方法来尝试 MolmoMotion。

译自 Hugging Face · 官方博客 · 录于 二〇二六年六月十七日