Hugging Face · Daily Papers

RynnWorld-4D:面向机器人操作的4D具身世界模型

RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation

Haoyu Zhao, Xingyue Zhao, Siteng Huang, Xin Li, Deli Zhao, Zhongyu Li
二〇二六年七月八日 · arXiv:2607.06559 · PDF · Code

开放世界中的机器人操作不仅需要识别场景的外观,还需要预测其三维结构在交互下如何运动。我们认为,同步的RGB、深度和光流(即RGB-DF)提供了一种物理上具身的表示,能够捕捉场景底层的四维动态。与二维像素视频相比,这种多模态协同将视觉外观与几何结构和时间运动对齐,创建了一个更接近机器人系统所需的低级末端执行器动作的表示空间,从而缩小了世界预测与策略学习之间的差距。基于这一洞察,我们提出了RynnWorld-4D,这是一个生成模型,能够从单张RGB-D图像和一条语言指令出发,在统一的扩散过程中联合生成未来的RGB帧、深度图和光流。该四维世界模型采用三分支架构,集成了跨模态注意力与逐帧三维旋转位置编码(3D RoPE),确保外观、几何和运动一致演化。为了大规模提供训练数据,我们整理了Rynn4DDataset 1.0,这是一个包含超过2.544亿帧的大规模数据集,涵盖自我中心视角的人类和机器人操作视频,并附有高质量的深度和光流伪标签。我们进一步提出了RynnWorld-4D-Policy,这是一个逆动力学头部,能够通过单次前向传播消耗RynnWorld-4D的内部四维表示,绕过昂贵的多步去噪过程,以闭环方式输出机器人动作。实验表明,RynnWorld-4D能够生成时空一致的四维预测,而RynnWorld-4D-Policy在真实世界的灵巧双臂操作任务中达到了最先进的性能,尤其在需要空间精度和时间协调的任务中表现突出。

译自 Hugging Face · Daily Papers · arXiv:2607.06559 · 录于 二〇二六年七月八日