DreamX-World 1.0:通用交互式世界模型
DreamX-World 1.0: A General-Purpose Interactive World Model
来自 AMAP-ML
摘要
DreamX-World 1.0 是一个通用的交互式文本/图像到视频世界模型,专为可控的长时程生成而设计。它支持相机导航、重新访问先前观察过的区域,以及跨照片级真实、游戏风格和风格化领域的可提示事件。我们的数据引擎结合了相机精确的Unreal Engine渲染、动作丰富的游戏录制以及带有恢复相机几何结构的真实世界视频。在相机控制方面,我们引入了E-PRoPE,这是一种投影位置编码的轻量级变体,它在保留PRoPE投影相机几何结构的同时,对空间缩减后的token应用了相机感知注意力。我们通过因果强制、DMD风格蒸馏和长展开训练,将一个双向视频生成器转换为几步自回归世界模型。在自生成的长时程上下文上进行训练,使模型暴露于自身生成的历史中,从而减少了跨自回归块累积的风格和颜色漂移。记忆条件场景持久性通过基于相机几何结构的检索来获取早期视图,而残差循环则使条件路径对不完美的记忆潜变量不那么敏感。事件指令微调增加了可组合的事件控制,而强化学习对齐则在蒸馏后恢复了相机控制和视觉质量。通过混合精度DiT执行、残差重用、75%剪枝的VAE解码以及异步流水线并行,DreamX-World 1.0在八块RTX 5090 GPU上达到了高达16 FPS的速度。在我们的5秒基础评估中,DreamX-World 1.0获得了73.75的相机控制分数和84.76的总分,在总分上优于HY-WorldPlay 1.5和LingBot-World,后两者分别达到了80.79和80.45。
译自 Hugging Face · Daily Papers · arXiv:2606.16993 · 录于 二〇二六年六月十六日