UniVR-34B-规划
UniVR-34B-Planning
UniVR 是一个基于 Emu3.5(34B)的统一视觉推理框架,采用 next-token prediction 目标直接从图像和指令生成视觉推理轨迹,无需中间文本链。训练分为两阶段:在 VR-X 数据集(16 个来源、6 个任务类别、310k 样本)上进行监督冷初始化,再通过 VR-GRPO 强化学习(3k 样本)优化,结合全局奖励与步骤聚焦奖励。在 VR-X 基准上,UniVR 相比 Emu3.5 基线提升 25%(总体 58.2 vs 39.8),并以 34B 参数接近 Gemini 3 Pro + Nano Banana 2(66.1)。
UniVR:在视觉空间中思考以实现统一视觉推理
模型摘要
UniVR 是首个能够从纯视觉演示中同时学习复杂推理、细粒度物理动态和长期规划的框架——无需依赖密集的图像-文本对或任务特定的启发式方法。
UniVR 基于 Emu3.5(34B),使用统一的 next-token prediction 目标,在给定图像和指令的情况下直接生成视觉推理轨迹。训练采用两阶段流程:在 VR-X 数据集上进行监督冷初始化,然后进行 VR-GRPO 强化学习,并辅以互补的全局奖励和步骤聚焦奖励。
| 特性 | 详情 |
|---|---|
| 架构 | Emu3.5 34B(VQ-VAE 统一生成模型) |
| 训练 | SFT(310k 样本)→ VR-GRPO RL(3k 样本) |
| 视觉思维 | 原生视觉空间推理,无中间文本链 |
| 基准 | VR-X:16 个来源,6 个任务类别,1.8k 评估样本 |
可用检查点
| 模型 | 描述 | 链接 |
|---|---|---|
| UniVR-34B-Planning | 针对长时域规划任务(机器人操作、工具使用、多步控制)优化 | maverickrzw/UniVR-34B-Planning |
| UniVR-34B-General | 完整的 UniVR 方案,包含交错图像-文本数据;适用于通用视觉推理 | maverickrzw/UniVR-34B-General |
关键结果
VR-X 基准
UniVR 相比 Emu3.5 基线提升了 25%,并以仅 34B 参数接近 Gemini 3 Pro + Nano Banana 2。
| 方法 | 视觉思维 | 引导 | 机器人 | 编辑 | 空间 | 拼图 | 搜索 | 总体↑ |
|---|---|---|---|---|---|---|---|---|
| Gemini-3-pro + Nano Banana 2 | ✗ | 66.2 | 67.1 | 63.7 | 55.1 | 65.5 | 79.0 | 66.1 |
| GPT-5 + GPT-image-1.5 | ✗ | 68.2 | 64.1 | 58.0 | 49.3 | 64.0 | 77.4 | 63.5 |
| Emu3.5 34B | ✗ | 38.6 | 42.8 | 32.7 | 35.3 | 43.4 | 46.2 | 39.8 |
| UniVR 34B | ✓ | 59.5 | 68.0 | 48.5 | 46.5 | 62.2 | 64.3 | 58.2 |
| Δ vs. Emu3.5 | ↑20.9 | ↑25.2 | ↑15.8 | ↑11.2 | ↑18.8 | ↑18.1 | ↑18.4 |
多模态理解
增强的视觉推理也提升了标准多模态基准——基础模型能力未出现退化。
| 方法 | MMMU | MME(P) | MME(C) | MMBench | MathVista | MM-Vet |
|---|---|---|---|---|---|---|
| Emu 3.5 | 0.292 | 781.1 | 324.6 | 0.183 | 41.7 | 28.0 |
| UniVR | 0.337 | 799.3 | 338.5 | 0.198 | 44.0 | 35.6 |
| Δ vs. Emu3.5 | ↑0.045 | ↑18.2 | ↑13.9 | ↑0.015 | ↑2.3 | ↑7.6 |
快速开始
安装
git clone https://github.com/MaverickRen/UniVR.git
cd UniVR
bash install.sh
推理
cd UniVR_SFT
# 下载检查点
huggingface-cli download maverickrzw/UniVR-34B-Planning --local-dir weights/UniVR-34B-Planning
# 下载 VisionTokenizer
huggingface-cli download BAAI/Emu3.5-VisionTokenizer --local-dir weights/Emu3.5-VisionTokenizer
# 运行推理
bash scripts/inference.sh
在 configs/config.py 中配置模型路径和提示:
{
"prompt": "将红绳系在白色礼品盒上。分 3 步完成此任务。",
"reference_image": "path/to/first_frame.jpg",
}
训练
SFT(冷初始化):
cd UniVR_SFT
# LoRA(2 节点 × 8 GPU)
bash scripts/train_sft_lora.sh
# 全参数(4 节点 × 8 GPU)
bash scripts/train_sft_full.sh
RL(VR-GRPO):
cd UniVR_RL
bash examples/emu3_grpo_lora.sh
方法:VR-GRPO
UniVR 提出了 VR-GRPO(视觉推理 GRPO),这是一种结合了以下组件的强化学习范式:
- 全局奖励(R_g):VLM 评估器通过成对比较评估整体任务完成度和视觉质量。
- 步骤聚焦奖励(R_s):通过计算 rollout 样本间轨迹间 CLIP 特征方差,识别最易出错的子步骤,然后在关键窗口上应用细粒度 VLM 评估。
- 组合奖励:
R_reason = R_g − λ|R_g − R_s|,同时确保终端正确性和过程完整性。
这种设计防止了在长时域任务中仅使用全局奖励会忽略中间物理违规和逻辑漏洞的奖励黑客行为。
示例输出
训练数据
UniVR 在 VR-X 上训练,这是一个大规模基准,从 16 个不同来源的 150 万原始样本中整理而成:
| 类别 | 来源 | 示例 |
|---|---|---|
| 视觉引导 | EgoDex, Action100M, Epic-Kitchen, VideoCraftBench | 烹饪、手工艺、日常活动 |
| 机器人操作 | AgiBot, Droid, Bridge, ZebraCoT-Robot | 机器人抓取、工具使用、多步控制 |
| 编辑 | ZebraCoT-Multiobject | 物体操作、场景编辑 |
| 空间感知 | ThinkMorph-Navigation, ZebraCoT-Embodiment | 导航、空间推理 |
| 视觉搜索 | VisualCoT, ThinkMorph-Search | 物体定位、注意力 |
| 拼图与游戏 | VRBench, Zebra-Jigsaw, ThinkMorph-VisPuzzle | 迷宫、拼图、视觉谜题 |
引用
@article{ren2026univr,
title={UniVR: Thinking in Visual Space for Unified Visual Reasoning},
author={Zhongwei Ren and Yunchao Wei and Zhao Yao and Guixun Luo and Yao Zhao and Weibo Gong and Xiao Liu and Anran Wang and Xiangtai Li and Xiaojie Jin},
year={2026},
}
许可证
本项目采用 CC BY 4.0 许可证发布。