Hugging Face · Daily Papers

Vidu S1:实时交互式视频生成模型

Vidu S1: A Real-Time Interactive Video Generation Model

Jintao Zhang, Kai Jiang, Jintao Chen, Xu Wang, Yang Luo, Yuji Wang, Dechuang Chen, Jungang Li 等 27 位
来自 Tsinghua University
二〇二六年七月十日 · arXiv:2607.03118 · PDF · Code

我们推出 Vidu S1,一款支持语音控制数字角色的实时交互式视频生成模型。用户可通过语音指令随时控制视频生成内容。Vidu S1 支持无限长度的实时视频生成,且不会出现模糊、漂移或视觉畸变。基于 TurboDiffusion 与 TurboServe 构建,Vidu S1 在普通消费级 GPU 上能以最高 42 FPS 的帧率输出 540p 实时视频。用户可上传真人、动漫及宠物的自定义图像,并选择不同的语音音色以获得个性化体验。实验表明,Vidu S1 在所有测试指标上均达到最佳性能,同时完全满足实时推理需求。可在线试玩的 demo 地址为 https://vidu.com/vidu-stream。

译自 Hugging Face · Daily Papers · arXiv:2607.03118 · 录于 二〇二六年七月十日