ByteDance · HF · 字节跳动

UniVR-34B-规划

UniVR-34B-Planning

二〇二六年八月四日 · 英文原文

UniVR 是一个基于 Emu3.5(34B)的统一视觉推理框架,采用 next-token prediction 目标直接从图像和指令生成视觉推理轨迹,无需中间文本链。训练分为两阶段:在 VR-X 数据集(16 个来源、6 个任务类别、310k 样本)上进行监督冷初始化,再通过 VR-GRPO 强化学习(3k 样本)优化,结合全局奖励与步骤聚焦奖励。在 VR-X 基准上,UniVR 相比 Emu3.5 基线提升 25%(总体 58.2 vs 39.8),并以 34B 参数接近 Gemini 3 Pro + Nano Banana 2(66.1)。

UniVR:在视觉空间中思考以实现统一视觉推理


模型摘要

UniVR 是首个能够从纯视觉演示中同时学习复杂推理、细粒度物理动态和长期规划的框架——无需依赖密集的图像-文本对或任务特定的启发式方法。

UniVR 基于 Emu3.5(34B),使用统一的 next-token prediction 目标,在给定图像和指令的情况下直接生成视觉推理轨迹。训练采用两阶段流程:在 VR-X 数据集上进行监督冷初始化,然后进行 VR-GRPO 强化学习,并辅以互补的全局奖励和步骤聚焦奖励。

特性 详情
架构 Emu3.5 34B(VQ-VAE 统一生成模型)
训练 SFT(310k 样本)→ VR-GRPO RL(3k 样本)
视觉思维 原生视觉空间推理,无中间文本链
基准 VR-X:16 个来源,6 个任务类别,1.8k 评估样本

可用检查点

模型 描述 链接
UniVR-34B-Planning 针对长时域规划任务(机器人操作、工具使用、多步控制)优化 maverickrzw/UniVR-34B-Planning
UniVR-34B-General 完整的 UniVR 方案,包含交错图像-文本数据;适用于通用视觉推理 maverickrzw/UniVR-34B-General

关键结果

VR-X 基准

UniVR 相比 Emu3.5 基线提升了 25%,并以仅 34B 参数接近 Gemini 3 Pro + Nano Banana 2。

方法 视觉思维 引导 机器人 编辑 空间 拼图 搜索 总体↑
Gemini-3-pro + Nano Banana 2 66.2 67.1 63.7 55.1 65.5 79.0 66.1
GPT-5 + GPT-image-1.5 68.2 64.1 58.0 49.3 64.0 77.4 63.5
Emu3.5 34B 38.6 42.8 32.7 35.3 43.4 46.2 39.8
UniVR 34B 59.5 68.0 48.5 46.5 62.2 64.3 58.2
Δ vs. Emu3.5 ↑20.9 ↑25.2 ↑15.8 ↑11.2 ↑18.8 ↑18.1 ↑18.4

多模态理解

增强的视觉推理也提升了标准多模态基准——基础模型能力未出现退化。

方法 MMMU MME(P) MME(C) MMBench MathVista MM-Vet
Emu 3.5 0.292 781.1 324.6 0.183 41.7 28.0
UniVR 0.337 799.3 338.5 0.198 44.0 35.6
Δ vs. Emu3.5 ↑0.045 ↑18.2 ↑13.9 ↑0.015 ↑2.3 ↑7.6

快速开始

安装

git clone https://github.com/MaverickRen/UniVR.git
cd UniVR
bash install.sh

推理

cd UniVR_SFT

# 下载检查点
huggingface-cli download maverickrzw/UniVR-34B-Planning --local-dir weights/UniVR-34B-Planning

# 下载 VisionTokenizer
huggingface-cli download BAAI/Emu3.5-VisionTokenizer --local-dir weights/Emu3.5-VisionTokenizer

# 运行推理
bash scripts/inference.sh

configs/config.py 中配置模型路径和提示:

{
    "prompt": "将红绳系在白色礼品盒上。分 3 步完成此任务。",
    "reference_image": "path/to/first_frame.jpg",
}

训练

SFT(冷初始化)

cd UniVR_SFT
# LoRA(2 节点 × 8 GPU)
bash scripts/train_sft_lora.sh
# 全参数(4 节点 × 8 GPU)
bash scripts/train_sft_full.sh

RL(VR-GRPO)

cd UniVR_RL
bash examples/emu3_grpo_lora.sh

方法:VR-GRPO

UniVR 提出了 VR-GRPO(视觉推理 GRPO),这是一种结合了以下组件的强化学习范式:

这种设计防止了在长时域任务中仅使用全局奖励会忽略中间物理违规和逻辑漏洞的奖励黑客行为。


示例输出


训练数据

UniVR 在 VR-X 上训练,这是一个大规模基准,从 16 个不同来源的 150 万原始样本中整理而成:

类别 来源 示例
视觉引导 EgoDex, Action100M, Epic-Kitchen, VideoCraftBench 烹饪、手工艺、日常活动
机器人操作 AgiBot, Droid, Bridge, ZebraCoT-Robot 机器人抓取、工具使用、多步控制
编辑 ZebraCoT-Multiobject 物体操作、场景编辑
空间感知 ThinkMorph-Navigation, ZebraCoT-Embodiment 导航、空间推理
视觉搜索 VisualCoT, ThinkMorph-Search 物体定位、注意力
拼图与游戏 VRBench, Zebra-Jigsaw, ThinkMorph-VisPuzzle 迷宫、拼图、视觉谜题

下载:maverickrzw/VR-X-SFT-RL


引用

@article{ren2026univr,
  title={UniVR: Thinking in Visual Space for Unified Visual Reasoning},
  author={Zhongwei Ren and Yunchao Wei and Zhao Yao and Guixun Luo and Yao Zhao and Weibo Gong and Xiao Liu and Anran Wang and Xiangtai Li and Xiaojie Jin},
  year={2026},
}

许可证

本项目采用 CC BY 4.0 许可证发布。

致谢

UniVR 基于 Emu3.5verl 构建。我们感谢作者们出色的开源贡献。

译自 ByteDance · HF · 字节跳动 · 录于 二〇二六年八月四日