Bernini-Diffusers
Bernini-Diffusers
字节跳动团队提出Bernini,一个统一视频生成与编辑框架,结合基于MLLM(Qwen2.5-VL)的语义规划器与基于DiT(Wan2.2)的渲染器。开源版本Bernini-Diffusers包含完整规划流程,在EditVerse、OpenVE、OpenS2V、VBench等benchmark上分别取得8.02、4.03、62.30、84.37分,视频编辑内部竞技评估达到闭源商业模型第一梯队。
Chenchen Liu*, Junyi Chen*, Lei Li*, Lu Chi*,§, Mingzhen Sun*, Zhuoying Li*, Yi Fu, Ruoyu Guo, Yiheng Wu, Ge Bai, Zehuan Yuan✉
* 同等贡献 ✉ 通讯作者 § 项目负责人
🎉 新闻
- [2026-06-10] 我们开源了完整版 Bernini(Bernini)的推理代码和模型权重。
- [2026-05-22] 我们发布了论文 Bernini: Latent Semantic Planning for Video Diffusion。
✨ 亮点
Bernini 是一个统一的视频生成与编辑框架,它将基于 MLLM 的语义规划器与基于 DiT 的渲染器相结合。
与仅包含渲染器的 Bernini-R 版本相比,Bernini-Diffusers 打包了完整的语义规划流程:一个 Qwen2.5-VL 规划器、Bernini 规划权重以及 Wan2.2 扩散组件,全部集成在一个独立的目录中。当您需要更强的指令遵循能力、多步语义规划以及更好地处理复杂视频编辑请求时,这是推荐的版本。
🧾 模型卡片
| 字段 | 描述 |
|---|---|
| 模型类型 | 包含基于 MLLM 的语义规划器和基于 DiT 的渲染器的完整视频生成/编辑流程。 |
| 检查点 | ByteDance/Bernini-Diffusers |
| 代码 | ByteDance/Bernini |
| 推荐用途 | 适用于受益于显式潜在语义规划和更强指令遵循能力的复杂生成/编辑请求。 |
| 模型行为 | 擅长在渲染前分解复杂指令并规划语义变化,代价是检查点布局比 Bernini-R 更重。 |
基准测试快照
| 模型 | EditVerse | OpenVE | OpenS2V | VBench | Bernini-v2v (OS) | Bernini-vr2v (OS) |
|---|---|---|---|---|---|---|
| Bernini 7+14B | 8.02 | 4.03 | 62.30 | 84.37 | 3.49 | 3.48 |
在视频编辑方面,基于盲人成对比较的内部竞技场评估中,Bernini 达到了领先闭源商业模型的第一梯队。
📦 包布局
此版本是一个自包含的 diffusers 格式目录。将下载的 Bernini-Diffusers 目录直接传递给 --config。
Bernini-Diffusers/
bernini/
mllm/
scheduler/
t5_text_encoder/
t5_tokenizer/
vae/
config.json
transformer_config.json
transformer_2_config.json
运行时:
bernini/提供 Bernini 规划检查点。mllm/提供 Qwen2.5-VL 规划器资源。transformer_config.json和transformer_2_config.json定义了完整流程使用的 Wan2.2 扩散解码器组件。t5_text_encoder/、t5_tokenizer/、vae/和scheduler/提供推理所需的基础扩散模块。
📥 下载
pip install -U "huggingface_hub"
hf download ByteDance/Bernini-Diffusers \
--local-dir pretrained_models/Bernini-Diffusers
🚀 使用
官方推理代码可在 Bernini 仓库 中找到。
安装
git clone https://github.com/bytedance/Bernini.git bernini && cd bernini
pip install -r requirements.txt
推荐环境:
- Python 3.11.2
- PyTorch 2.5.1+cu124
- CUDA toolkit 12.4
- GPU 推荐使用 Hopper GPU(H100/H800/H200)以获得最佳性能
对于多 GPU 序列并行推理,安装 VeOmni:
pip install --no-deps git+https://github.com/ByteDance-Seed/VeOmni.git@v0.1.10
加载模型
将下载的目录直接作为 --config 传递:
python infer_single_gpu.py --config pretrained_models/Bernini-Diffusers \
--case assets/testcases/i2i/i2i.json --num_frames 1
提示增强器(强烈推荐)
--use_pe 通过兼容 OpenAI 的端点增强提示,建议用于最佳生成质量。
export BERNINI_PE_API_KEY=... # 或 OPENAI_API_KEY
export BERNINI_PE_BASE_URL=... # 或 OPENAI_BASE_URL
export BERNINI_PE_MODEL=... # 支持视觉的聊天模型
Gradio 演示
# 单 GPU
python gradio_demo.py --config pretrained_models/Bernini-Diffusers --port 7860
# 8 GPU,8 路 Ulysses 序列并行
torchrun --nproc-per-node 8 gradio_demo.py --ulysses 8 \
--config pretrained_models/Bernini-Diffusers \
--port 7860 --share
运行脚本
Bernini 仓库中的 scripts/bernini/ 目录提供了完整流程的即用型任务启动器:
run_t2i.shrun_i2i.shrun_t2v.shrun_v2v.shrun_rv2v.shrun_r2v.shrun_gradio.sh
您可以通过以下方式覆盖模型目录:
export BERNINI_CONFIG=/path/to/Bernini-Diffusers
📑 引用
如果您在研究中使用 Bernini,请引用:
@article{bernini,
title = {Bernini: Latent Semantic Planning for Video Diffusion},
author = {Chenchen Liu and Junyi Chen and Lei Li and Lu Chi and Mingzhen Sun and Zhuoying Li and Yi Fu and Ruoyu Guo and Yiheng Wu and Ge Bai and Zehuan Yuan},
journal = {arXiv preprint arXiv:2605.22344},
year = {2026}
}
🙏 致谢
Bernini 建立在多个优秀的开源项目之上:
📄 许可证
Apache License 2.0。