Hugging Face · Daily Papers

Alaya-EVOKE:从线性扩展监督到无尽世界

Alaya-EVOKE: From Linear-Scaling Supervision to Endless World

Yuanyang Yin, Gongxuan Wang, Yifan Zhan, Chuanhao Li, Kaipeng Zhang, Feng Zhao
二〇二六年八月十四日 · arXiv:2608.13546 · PDF

交互式世界模型必须支持持久记忆、响应式交互和长时程生成,然而这些需求对模型提出了相互冲突的要求。在去噪器上下文或键值缓存中维护历史会带来不断增长的开销,迫使在会话长度与保留记忆之间做出权衡,而低延迟交互依赖于少步生成,其能力受限于其教师模型。Evoke通过外部化持久世界状态并重新设计教师模型以支持长时程交互生成,解决了这两方面的局限。场景几何信息维护在一个外部的、以相机索引的世界状态库中,仅检索与当前视角相关的信息,从而在会话增长时保持去噪器上下文有界。我们并未将教师模型视为固定生成器,而是为其设计了长时程监督:其稀疏注意力结合了分块分组、选定远帧的检索以及线性注意力全局状态,使内存和计算呈线性增长,同时支持长时程监督。这种监督暴露了在短窗口内局部看似合理的内容漂移,而逐块条件化则支持整个序列中的提示更改和事件控制。一个30秒的分布匹配目标,在自强制展开下应用,将这两种能力迁移到不使用无分类器引导的三步学生模型中,在保持响应式条件化的同时提高了对长期漂移的抵抗能力。凭借有界上下文和循环外部记忆,Evoke支持开放式、持续演化的生成;在单个H200上,384×640分辨率下,每个1.5秒块生成耗时2.11秒。作为三步世界模型,Evoke在WBench上达到最先进性能,同时在VBench-Long和VBench-2.0上保持竞争力。

译自 Hugging Face · Daily Papers · arXiv:2608.13546 · 录于 二〇二六年八月十四日