ByteDance · HF · 字节跳动

Bernini-Diffusers-v2

Bernini-Diffusers-v2

二〇二六年八月二十六日 · 英文原文

ByteDance 发布 Bernini,一个统一的视频生成与编辑框架,结合基于 MLLM 的语义规划器(Qwen2.5-VL-7B-Instruct)与基于 DiT 的渲染器(Wan2.2-T2V-A14B)。开源版本 Bernini-Diffusers-v2 为自包含 diffusers 格式目录,支持 t2i、i2i、t2v、v2v、rv2v、r2v 任务。在 EditVerse、OpenVE、OpenS2V、VBench 基准上分别取得 8.02、3.96、63.83、84.46 分。代码与权重已公开于 GitHub 与 HuggingFace。

Chenchen Liu*, Junyi Chen*, Lei Li*, Lu Chi*,§, Mingzhen Sun*, Zhuoying Li*, Yi Fu, Ruoyu Guo, Yiheng Wu, Ge Bai, Zehuan Yuan✉

* 同等贡献  ✉ 通讯作者  § 项目负责人

arXiv Project Page HuggingFace

🎉 新闻

✨ 亮点

Bernini 是一个统一的视频生成与编辑框架,将基于 MLLM 的语义规划器与基于 DiT 的渲染器相结合。

Bernini-Diffusers-v2 打包了完整的语义规划流程:Qwen2.5-VL 规划器、Bernini 规划权重以及 Wan2.2 扩散组件,全部集成在一个自包含的 diffusers 格式目录中。

与仅含渲染器的 Bernini-R 版本相比,当您需要更强的指令遵循能力、多步语义规划以及更好地处理复杂视频生成或编辑请求时,推荐使用 Bernini-Diffusers-v2。与首个 Bernini-Diffusers 版本相比,v2 采用了一种训练方案,在联合训练前先对连接器进行数千步的预热,从而提升了参考引导的视频编辑和 OpenS2V 性能。

🧾 模型卡

字段 描述
模型类型 完整的视频生成/编辑流程,包含基于 MLLM 的语义规划器和基于 DiT 的渲染器。
检查点 ByteDance/Bernini-Diffusers-v2
代码 ByteDance/Bernini
渲染器基础 Wan2.2-T2V-A14B
规划器基础 Qwen2.5-VL-7B-Instruct
推荐用途 受益于显式潜在语义规划和更强指令遵循能力的复杂生成/编辑请求。
支持任务 t2ii2it2vv2vrv2vr2v
模型行为 在渲染前分解复杂指令并规划语义变化,代价是检查点布局比 Bernini-R 更重。

基准测试快照

模型 EditVerse OpenVE OpenS2V VBench Bernini-v2v (OS) Bernini-rv2v (OS)
Bernini-v2 7+14B 8.02 3.96 63.83 84.46 3.49 3.55

在视频编辑方面,根据基于盲测人类成对比较的内部竞技场评估,Bernini 在领先的闭源商业模型中达到了第一梯队。

📦 包结构

本次发布是一个自包含的 diffusers 格式目录。将下载的 Bernini-Diffusers-v2 目录直接传递给 --config

Bernini-Diffusers-v2/
  bernini/
  mllm/
  scheduler/
  t5_text_encoder/
  t5_tokenizer/
  vae/
  config.json
  transformer_config.json
  transformer_2_config.json

运行时:

📥 下载

pip install -U "huggingface_hub"
hf download ByteDance/Bernini-Diffusers-v2 \
    --local-dir pretrained_models/Bernini-Diffusers-v2

🚀 使用方法

官方推理代码可在 Bernini 仓库 中获取。

安装

git clone https://github.com/bytedance/Bernini.git bernini && cd bernini
pip install -r requirements.txt
# 需要 Open-VeOmni。使用 --no-deps 安装,以免引入不同版本的 torch 并覆盖固定的 torch==2.7.1+cu126:
pip install --no-deps git+https://github.com/ByteDance-Seed/VeOmni.git@v0.1.11

推荐环境:

加载模型

将下载的目录直接作为 --config 传递:

python infer_single_gpu.py --config pretrained_models/Bernini-Diffusers-v2 \
    --case assets/testcases/i2i/i2i.json --num_frames 1

Prompt 增强器(强烈推荐)

--use_pe 通过兼容 OpenAI 的端点增强 prompt,推荐用于获得最佳生成质量。

export BERNINI_PE_API_KEY=...      # 或 OPENAI_API_KEY
export BERNINI_PE_BASE_URL=...     # 或 OPENAI_BASE_URL
export BERNINI_PE_MODEL=...        # 支持视觉的聊天模型

Gradio 演示

# 单 GPU
python gradio_demo.py --config pretrained_models/Bernini-Diffusers-v2 --port 7860

# 8 GPU,8 路 Ulysses 序列并行
torchrun --nproc-per-node 8 gradio_demo.py --ulysses 8 \
    --config pretrained_models/Bernini-Diffusers-v2 \
    --port 7860 --share

运行脚本

Bernini 仓库中的 scripts/bernini_v2/ 目录为 Bernini-Diffusers-v2 提供了可直接运行的任务启动器:

您可以通过以下方式覆盖模型目录:

export BERNINI_CONFIG=/path/to/Bernini-Diffusers-v2

📑 引用

如果您在研究中使用 Bernini,请引用:

@article{bernini,
  title   = {Bernini: Latent Semantic Planning for Video Diffusion},
  author  = {Chenchen Liu and Junyi Chen and Lei Li and Lu Chi and Mingzhen Sun and Zhuoying Li and Yi Fu and Ruoyu Guo and Yiheng Wu and Ge Bai and Zehuan Yuan},
  journal = {arXiv preprint arXiv:2605.22344},
  year    = {2026}
}

🙏 致谢

Bernini 建立在多个优秀的开源项目之上:

📄 许可证

Apache License 2.0。

译自 ByteDance · HF · 字节跳动 · 录于 二〇二六年八月二十六日