发布 vime:一个简单、稳定且高效的 LLM 强化学习框架
Announcing vime: A Simple, Stable, and Efficient RL Framework for LLMs
vLLM 社区发布 LLM 后训练框架 vime,基于 slime 的训练栈与数据生成设计,将 Megatron 训练与 vLLM 推理引擎连接为统一 RL pipeline。vime 采用三阶段解耦架构(Megatron 训练、vLLM+Router rollout、数据缓冲区),支持 GRPO、PPO 等算法及 Qwen3 Dense/MoE、GLM-4.5 等模型。在 Qwen3-30B-A3B 上使用 8-GPU 同地部署与 GRPO,GB200 平均 step 时间约 147 秒,H200 约 252 秒,GB200 端到端速度约为 H200 的 1.72 倍。R3 路由重放将 MoE 模型 logprob 差异从约 0.019 降至约 0.013。vime 以 Apache 2.0 开源,由 vLLM 社区维护。
我们很高兴推出 vime,这是 vLLM 生态中的一个 LLM 后训练框架。vime 基于 slime 的训练栈和数据生成设计,将 Megatron 和 vLLM 连接成一个统一的 RL pipeline,使分布式训练和推理能够在单一架构下稳定运行。
slime 已被证明是一个优秀的 RL 后训练工程范式:开放、轻量且高效。vime 将 vLLM 生态引入 slime,将 slime 的训练栈与 vLLM 的推理优势结合成一个简单、稳定、高效的主 pipeline——提供稳定的训练-推理对齐、灵活的部署模式以及全栈 GPU 支持。
我们的愿景
兼具实战可信度与开源基因的 RL 框架一直很少见。slime 在 GLM 等模型上得到验证,是一个代表性框架:开放、轻量、简洁、高效。但它并未原生集成 vLLM 后端。与此同时,vLLM 是社区中最活跃的推理引擎,融合了前沿技术、多平台生态和快速迭代。
vime 的使命是将 slime 的训练设计与 vLLM 的推理优势连接成一个简单、稳定、高效的 pipeline。开发者不应在单一硬件栈、训练稳定性和推理性能之间做出取舍。
定位
vLLM 社区支持广泛的 LLM 后训练框架,包括(按字母顺序)NeMo RL、OpenRLHF、verl 等。我们构建 vime 是为了将 slime 经过验证的训练范式无缝引入 vLLM 生态,提供一个生产就绪的桥梁,使两个项目的快速发布周期保持一致。
我们希望有不同需求的用户都能找到适合其工作流的 vLLM 生态选择。vLLM 社区将继续支持更广泛后训练生态中的 vLLM 集成。
架构概览
vime 采用 slime 的三阶段解耦训练-推理设计,关键区别在于 rollout 后端替换为 vLLM:
- 训练(Megatron):主训练循环,负责参数更新并将权重同步到 rollout 侧。
- Rollout(vLLM + Router):推理采样,生成带有奖励或验证器信号的训练样本。
- 数据缓冲区:连接训练侧和 rollout 侧,管理 prompt 注入和自定义 rollout 逻辑。

vime 通过解耦的数据缓冲区将 Megatron 训练与 vLLM 驱动的 rollout 连接起来。
关键能力
- 易于使用:参数系统继承 slime 和 Megatron 的惯例,vLLM 侧参数通过
--vllm-前缀传递。默认 rollout 入口点为vime.rollout.vllm_rollout。 - 稳定的训练-推理对齐:在典型的 Dense 和 MoE 场景中,
train_rollout_logprob_abs_diff在长时间运行中保持在可控范围内。对于 MoE,R3(路由重放)进一步减少了训练-推理不匹配。 - 算法和模型覆盖:RL 算法如 GRPO 和 PPO,以及包括 Qwen3 Dense/MoE 和 GLM-4.5 在内的模型,均附带端到端示例和 CI 验证路径。
- 多硬件支持:在框架层面,训练资源、rollout 资源和集群拓扑被统一抽象,使得随着 vLLM 生态的支持演进,更容易在不同硬件后端上复用相同的 RL pipeline。
验证与基准测试
对于 Qwen3-30B-A3B 使用 8-GPU 同地部署、dapo-math-17k 和 GRPO,GB200 平均 step 时间约为 147 秒,而 H200 平均 step 时间约为 252 秒。在相同框架下,GB200 端到端 step 速度约为 H200 的 1.72 倍。

Qwen3-30B-A3B vime 在 GB200 和 H200 上的 step 速度。
我们还在跨硬件的代表性工作负载上验证了训练-推理一致性和端到端功能。
Qwen3-4B 在 A100 上
对于 Qwen3-4B 在 A100 上使用 GRPO、4 训练 + 4 推理非同地部署和 gsm8k,vime 的 train_rollout_logprob_abs_diff 在整个训练过程中稳定在 0.011 左右。基线随着训练进行持续漂移到 0.77 左右,而 vime 提供了更稳定的训练-推理对齐。

Qwen3-4B vime 与基线训练行为对比。
Qwen3-30B-A3B MoE 使用 R3
对于 Qwen3-30B-A3B MoE 在 A100 上使用 4 训练 GPU、4 推理 GPU、dapo-math-17k 和 EP=4,启用 vime 的 R3 路由重放将 logprob 差异从大约 0.019 降低到大约 0.013,显著减少了 MoE 训练-推理不匹配。

R3 路由重放减少了 Qwen3-30B-A3B MoE 的训练-推理不匹配。
Qwen3-30B-A3B MoE 在 GB200 上
对于 Qwen3-30B-A3B MoE 在 GB200 上使用 8-GPU 同地部署和 dapo-math-17k,vime 和基线的 raw_reward 曲线紧密对齐。两者都将 train_rollout_logprob_abs_diff 稳定在 0.018 左右,没有持续的基线侧漂移。

Qwen3-30B-A3B MoE 在 GB200 上在同地部署训练和 rollout 中表现出稳定的对齐。
GLM-4.5-Air 在 GB200 上
对于 GLM-4.5-Air 在 GB200 上使用 GRPO、8-GPU 同地部署和 dapo-math-17k,raw_reward 在 100 个 step 中呈上升趋势,均值约为 0.56。train_rollout_logprob_abs_diff 保持在 0.02-0.03 范围内,均值约为 0.028,表明训练-推理对齐良好。

GLM-4.5-Air 在 GB200 上在奖励提升的同时保持稳定的 logprob 对齐。
路线图
vime 仍在快速发展中,路线图聚焦于三个领域:
- 更深入的 vLLM 集成:持续采用新的 vLLM 能力,如 Router、PD 分离、FP8 和多模型服务。
- 多硬件扩展:沿 vLLM 的硬件插件系统扩展后端,使 vime 在更多加速器和集群配置上高效运行。
- 训练效率与算法:全异步 pipeline、训练-推理不匹配修正、面向多轮工具调用和多智能体设置的 Agentic RL,以及对 MoE 和 VLM 等新架构的快速跟进。
快速开始
入门路径与 slime 类似:配置 Megatron 训练资源和 vLLM rollout 资源,准备 checkpoint 和数据,然后启动 train.py 或 train_async.py。
- 文档:快速开始
- 示例:
scripts/和examples/目录涵盖了 Qwen3-4B、Qwen3-30B-A3B MoE 和 GLM-4.5-Air 等场景。
vime 由 vLLM 社区维护,以 Apache 2.0 开源,并建立在 slime、Megatron-LM 和 vLLM 等项目的基础上。
- 代码和文档:github.com/vllm-project/vime
- 贡献:欢迎提交 Issue 和 PR。Pre-commit 保持代码风格一致。
- 反馈:在 GitHub 上分享你的经验、性能数据和功能建议。
简洁的架构、稳定的行为和高效的性能:vime 旨在为更多开发者铺平 RL 后训练的主 pipeline。加入我们,帮助将这一 pipeline 带到更多场景。
致谢
贡献者: Ao Shen、kaiyuan、princepride、Dakai An、knlnguyen1802、gcanlin、SamitHuang 和 Meihan-chen。
我们感谢 slime、Megatron-LM 和 vLLM 项目的维护者所做的开创性工作。我们还要感谢 Kaichao You、Roger Wang、Hongsheng Liu 和 Xiyuan Wang 对 vime 项目的支持和组织贡献。