DreamX-Phi 1.0:面向机器人操作的动作条件视频世界模型
DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation
来自 alibaba
摘要
我们提出DreamX-Phi 1.0,一个用于机器人操作的动作条件视频世界模型。给定一个观测帧、一条语言指令以及由末端执行器姿态和夹爪状态组成的预设动作序列,该模型预测由此产生的未来观测。然而,仅凭逼真度并不能保证忠实性:一个令人信服的推演仍可能移动错误的手臂或丢失被操作物体。为确保预测尊重每只手臂的命令路径,我们通过PRoPE风格的几何编码将每只手臂的SE(3)变换注入注意力机制,从而保持手臂身份和刚体运动结构。仅靠动作控制无法完全约束场景几何或小型被操作物体的演变。因此,我们添加了一个轻量级深度分支用于场景级几何,并使用SAM3掩码配合冻结的V-JEPA教师模型来维持抓取过程中的物体一致性。我们进一步通过分布匹配蒸馏将多步生成器蒸馏为少步学生模型,以实现高效部署。截至撰写本文时,我们的方法在WorldArena 2.0挑战赛的Track 1中取得第一名,在Track 2中取得第二名。我们的模型和代码将公开发布。
译自 Hugging Face · Daily Papers · arXiv:2608.13489 · 录于 二〇二六年八月十四日