Hugging Face · Daily Papers

超越像素:从视频先验到4D世界

Beyond Pixels: From Video Priors to 4D Worlds

Zihao Liu, Xiaolong Shen, Zhenglin Zhou, Ruijie Quan, Yi Yang
二〇二六年八月十二日 · arXiv:2608.10744 · PDF

4D生成从文本或图像等条件合成动态3D场景。现有方法要么使用独立的4D模型重建生成的RGB视频,要么调整特定的视频生成器直接预测几何结构。前者面临分布不匹配和误差传播的问题,而后者将4D预测绑定到特定生成器,当生成器或条件设置变化时可能需要重新训练。我们探讨是否共享变分自编码器(VAE)的视频模型的最终去噪潜变量,可以作为显式4D预测的可复用接口。基于这一见解,我们引入了直接潜变量到4D生成方法,并将其实现为Latent-to-4D,该方法通过将视频潜变量与预训练4D解码器的标记网格对齐,并通过逐帧和全局时空注意力进行细化,从而绕过RGB。在约1K个现有重建片段上训练后,单个检查点可在同一VAE家族内的多个视频扩散变换器上无需修改地迁移。在Text4D-200和I4D-200基准上,Latent-to-4D在基于投影的DINO-F1指标上分别超过匹配同潜变量的Wan+4RC级联方法2.88至3.45分和5.81分,同时在几何结构、时间稳定性和整体质量方面也获得人类评估者的偏好。

译自 Hugging Face · Daily Papers · arXiv:2608.10744 · 录于 二〇二六年八月十二日