Hugging Face · Daily Papers

ABot-World-0:单桌面GPU上的无限交互世界展开

ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU

Fan Jiang, Zhaoxu Sun, Mengchao Wang, Ziyu Zhu, Chiyu Wang, Yunpeng Zhang, Wenlin Liu, Yun Wang 等 41 位
二〇二六年七月二十二日 · arXiv:2607.19191 · PDF

我们提出 ABot-World-0,一个基于动作条件(action-conditioned)的视频世界模型,支持实时、长程闭环交互。该模型依托一个跨 AAA 游戏、仿真引擎和互联网视频的多源数据基础设施,以学习可控的世界动态。WorldExplorer 根据训练反馈执行智能体驱动的数据收集,而统一的数据处理管线则应用 14 项确定性质量检查、基于 VLM 的评估,以及同步的动作与文本标注。我们通过教师强制(teacher forcing)和 ODE 蒸馏,逐步将双向动作条件的教师模型蒸馏为因果学生模型,并引入 LongForcing 来对齐学生模型的长程自滚动与扩展视野的教师模型,从而缓解累积的分布偏移和自回归漂移。原始键盘动作为场景漫游和第三人称角色交互提供了统一控制接口,而参考角色记忆则为第三人称滚动中的身份一致性提供持续的外观线索。在部署方面,我们协同设计了流式推理栈,包含轻量级 VAE 解码器、高效注意力机制、内存感知调度和低比特 DiT 推理。在优化的低比特配置下,ABot-World-0 在单张 NVIDIA RTX 5090 桌面 GPU 上以最高 16 FPS 流式输出 720P 视频,动作到首帧延迟为 1.2 秒,峰值显存约 19GiB。在 WorldRoamBench 和扩展交互滚动上的实验表明,该模型具有竞争性的可控性和连贯的长程世界演化能力。

译自 Hugging Face · Daily Papers · arXiv:2607.19191 · 录于 二〇二六年七月二十二日