Hugging Face · Daily Papers

JoyAI-Video-Edit:基于自回归扩散的实时开放式视频编辑

JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion

Yicheng Xiao, Wenxun Dai, Xinran Qin, Lin Song, Maoquan Zhang, Hang Xu, Yukang Chen, Yitong Li 等 25 位
来自 jingdong
二〇二六年八月五日 · arXiv:2608.03974 · PDF · Code

实时视频编辑需要在有限计算资源下实现低延迟的因果生成,同时保持源保真度和长期时间一致性。我们提出JoyAI-Video-Edit,一个160亿参数的自回归扩散框架,用于实时、开放式视频编辑,无需访问未来帧或预设视频时长。该方法结合了分块自回归适应、源锚定分布匹配蒸馏(SA-DMD)和长视界自回归蒸馏,以减少训练与推理之间的不匹配,在两步生成中保持源保真度,并缓解累积的时间漂移。广泛的自动和人工评估表明,JoyAI-Video-Edit显著优于现有流式编辑器,并在短视频和长视频上与强离线系统保持竞争力。完整系统在单个Nvidia B200 GPU上实现约30 FPS的端到端720p视频编辑。代码可在https://github.com/jd-opensource/JoyAI-Video-Edit获取。

译自 Hugging Face · Daily Papers · arXiv:2608.03974 · 录于 二〇二六年八月五日