Vidu S1:实时交互式视频生成模型
Vidu S1: A Real-Time Interactive Video Generation Model
来自 Tsinghua University
摘要
我们推出 Vidu S1,一款支持语音控制数字角色的实时交互式视频生成模型。用户可通过语音指令随时控制视频生成内容。Vidu S1 支持无限长度的实时视频生成,且不会出现模糊、漂移或视觉畸变。基于 TurboDiffusion 与 TurboServe 构建,Vidu S1 在普通消费级 GPU 上能以最高 42 FPS 的帧率输出 540p 实时视频。用户可上传真人、动漫及宠物的自定义图像,并选择不同的语音音色以获得个性化体验。实验表明,Vidu S1 在所有测试指标上均达到最佳性能,同时完全满足实时推理需求。可在线试玩的 demo 地址为 https://vidu.com/vidu-stream。
译自 Hugging Face · Daily Papers · arXiv:2607.03118 · 录于 二〇二六年七月十日