vLLM · 官方博客

发布 vime:一个简单、稳定且高效的 LLM 强化学习框架

Announcing vime: A Simple, Stable, and Efficient RL Framework for LLMs

二〇二六年六月九日 · 英文原文

vLLM 社区发布 LLM 后训练框架 vime,基于 slime 的训练栈与数据生成设计,将 Megatron 训练与 vLLM 推理引擎连接为统一 RL pipeline。vime 采用三阶段解耦架构(Megatron 训练、vLLM+Router rollout、数据缓冲区),支持 GRPO、PPO 等算法及 Qwen3 Dense/MoE、GLM-4.5 等模型。在 Qwen3-30B-A3B 上使用 8-GPU 同地部署与 GRPO,GB200 平均 step 时间约 147 秒,H200 约 252 秒,GB200 端到端速度约为 H200 的 1.72 倍。R3 路由重放将 MoE 模型 logprob 差异从约 0.019 降至约 0.013。vime 以 Apache 2.0 开源,由 vLLM 社区维护。

我们很高兴推出 vime,这是 vLLM 生态中的一个 LLM 后训练框架。vime 基于 slime 的训练栈和数据生成设计,将 Megatron 和 vLLM 连接成一个统一的 RL pipeline,使分布式训练和推理能够在单一架构下稳定运行。

slime 已被证明是一个优秀的 RL 后训练工程范式:开放、轻量且高效。vime 将 vLLM 生态引入 slime,将 slime 的训练栈与 vLLM 的推理优势结合成一个简单、稳定、高效的主 pipeline——提供稳定的训练-推理对齐、灵活的部署模式以及全栈 GPU 支持。

我们的愿景

兼具实战可信度与开源基因的 RL 框架一直很少见。slime 在 GLM 等模型上得到验证,是一个代表性框架:开放、轻量、简洁、高效。但它并未原生集成 vLLM 后端。与此同时,vLLM 是社区中最活跃的推理引擎,融合了前沿技术、多平台生态和快速迭代。

vime 的使命是将 slime 的训练设计与 vLLM 的推理优势连接成一个简单、稳定、高效的 pipeline。开发者不应在单一硬件栈、训练稳定性和推理性能之间做出取舍。

定位

vLLM 社区支持广泛的 LLM 后训练框架,包括(按字母顺序)NeMo RLOpenRLHFverl 等。我们构建 vime 是为了将 slime 经过验证的训练范式无缝引入 vLLM 生态,提供一个生产就绪的桥梁,使两个项目的快速发布周期保持一致。

我们希望有不同需求的用户都能找到适合其工作流的 vLLM 生态选择。vLLM 社区将继续支持更广泛后训练生态中的 vLLM 集成。

架构概览

vime 采用 slime 的三阶段解耦训练-推理设计,关键区别在于 rollout 后端替换为 vLLM:

图 1:vime 通过解耦的数据缓冲区将 Megatron 训练与 vLLM 驱动的 rollout 连接起来。

vime 通过解耦的数据缓冲区将 Megatron 训练与 vLLM 驱动的 rollout 连接起来。

关键能力

验证与基准测试

对于 Qwen3-30B-A3B 使用 8-GPU 同地部署、dapo-math-17k 和 GRPO,GB200 平均 step 时间约为 147 秒,而 H200 平均 step 时间约为 252 秒。在相同框架下,GB200 端到端 step 速度约为 H200 的 1.72 倍

图 2:Qwen3-30B-A3B vime 在 GB200 和 H200 上的 step 速度。

Qwen3-30B-A3B vime 在 GB200 和 H200 上的 step 速度。

我们还在跨硬件的代表性工作负载上验证了训练-推理一致性和端到端功能。

Qwen3-4B 在 A100 上

对于 Qwen3-4B 在 A100 上使用 GRPO、4 训练 + 4 推理非同地部署和 gsm8k,vime 的 train_rollout_logprob_abs_diff 在整个训练过程中稳定在 0.011 左右。基线随着训练进行持续漂移到 0.77 左右,而 vime 提供了更稳定的训练-推理对齐。

图 3:Qwen3-4B vime 与基线训练行为对比。

Qwen3-4B vime 与基线训练行为对比。

Qwen3-30B-A3B MoE 使用 R3

对于 Qwen3-30B-A3B MoE 在 A100 上使用 4 训练 GPU、4 推理 GPU、dapo-math-17k 和 EP=4,启用 vime 的 R3 路由重放将 logprob 差异从大约 0.019 降低到大约 0.013,显著减少了 MoE 训练-推理不匹配。

图 4:R3 路由重放减少了 Qwen3-30B-A3B MoE 的训练-推理不匹配。

R3 路由重放减少了 Qwen3-30B-A3B MoE 的训练-推理不匹配。

Qwen3-30B-A3B MoE 在 GB200 上

对于 Qwen3-30B-A3B MoE 在 GB200 上使用 8-GPU 同地部署和 dapo-math-17k,vime 和基线的 raw_reward 曲线紧密对齐。两者都将 train_rollout_logprob_abs_diff 稳定在 0.018 左右,没有持续的基线侧漂移。

图 5:Qwen3-30B-A3B MoE 在 GB200 上在同地部署训练和 rollout 中表现出稳定的对齐。

Qwen3-30B-A3B MoE 在 GB200 上在同地部署训练和 rollout 中表现出稳定的对齐。

GLM-4.5-Air 在 GB200 上

对于 GLM-4.5-Air 在 GB200 上使用 GRPO、8-GPU 同地部署和 dapo-math-17k,raw_reward 在 100 个 step 中呈上升趋势,均值约为 0.56train_rollout_logprob_abs_diff 保持在 0.02-0.03 范围内,均值约为 0.028,表明训练-推理对齐良好。

图 6:GLM-4.5-Air 在 GB200 上在奖励提升的同时保持稳定的 logprob 对齐。

GLM-4.5-Air 在 GB200 上在奖励提升的同时保持稳定的 logprob 对齐。

路线图

vime 仍在快速发展中,路线图聚焦于三个领域:

快速开始

入门路径与 slime 类似:配置 Megatron 训练资源和 vLLM rollout 资源,准备 checkpoint 和数据,然后启动 train.pytrain_async.py

vime 由 vLLM 社区维护,以 Apache 2.0 开源,并建立在 slime、Megatron-LM 和 vLLM 等项目的基础上。

简洁的架构、稳定的行为和高效的性能:vime 旨在为更多开发者铺平 RL 后训练的主 pipeline。加入我们,帮助将这一 pipeline 带到更多场景。

致谢

贡献者: Ao Shen、kaiyuan、princepride、Dakai An、knlnguyen1802、gcanlin、SamitHuang 和 Meihan-chen。

我们感谢 slimeMegatron-LMvLLM 项目的维护者所做的开创性工作。我们还要感谢 Kaichao You、Roger Wang、Hongsheng Liu 和 Xiyuan Wang 对 vime 项目的支持和组织贡献。

译自 vLLM · 官方博客 · 录于 二〇二六年六月九日