开源社区支持OpenEnv用于Agentic RL
The Open Source Community is backing OpenEnv for Agentic RL
Hugging Face 宣布 OpenEnv 项目转为由 Meta-PyTorch、Unsloth、Nvidia 等组成的委员会治理,代码迁移至 huggingface/OpenEnv。OpenEnv 定位为 RL 环境的互操作层,标准化 agent 执行环境的发布与部署,支持 HTTP、WebSocket 及 MCP 协议,并提供 Gymnasium 风格 API。后续计划包括通过 datasets 集成任务集、外部奖励定义、持续集成框架及自动验证。PyTorch Foundation、vLLM、Lightning AI 等机构已表示支持。
](https://huggingface.co/burtenshaw)
OpenEnv 是一个用于创建 agent 执行环境的工具,例如终端、浏览器,或任何 agent 可以与之交互的环境。今天,我们很高兴地宣布 OpenEnv 将变得更加开放,以推动训练 agent 的未来走向开源。
从今天起,OpenEnv 将由一个委员会协调,该委员会目前包括 Meta-PyTorch、Reflection、Unsloth、Modal、Prime Intellect、Nvidia、Mercor、Fleet AI 和 Hugging Face。OpenEnv 现在位于 huggingface/OpenEnv。
OpenEnv 项目已获得 AI 生态系统中一些领先组织的支持和采用,包括 PyTorch Foundation、vLLM、SkyRL (UCB)、Lightning AI、Axolotl AI、Stanford Scaling Intelligence Lab、Mithril、OpenMined、Scaler AI Labs、Scale AI、Patronus AI、Surge AI、Halluminate、Turing、Scorecard 和 Snorkel AI。
为什么我们需要 OpenEnv 来训练开源 agent
像 Claude Code、Codex、OpenClaw 和 Hermes 这样的 agent 框架(harness)在不断进步。它们进步的一个原因是,像 GPT-5.5 和 Opus 4.8 这样的模型经过了训练,能够使用各自的框架。
我们也希望开源模型能获得同样的提升:训练本地模型以有效使用这些框架,并通过为特定任务定制模型来节省计算资源。
为什么我们需要(更加)开放
前沿实验室训练的模型和框架,在很大程度上是紧密配合的。模型经过训练以使用该框架,并针对其特性进行了优化。模型可以在一定程度上泛化到这些框架之外,但没有什么能比得上训练带来的效率。
在开源领域,情况并非如此。开发者可以根据自己看重的用例,使用任何框架、任何模型、任何推理引擎。这对社区来说是根本性的,但也是一个需要基础设施和工具来应对的挑战。
这就是 OpenEnv 发挥作用的地方。它是一个在框架、环境和训练器之间建立接口的库,适用于任何模型。为了使其持久发展,它需要由所有主要利益相关方共同拥有。
一个协议层,而非奖励框架
伴随着治理结构的变更,我们也在明确 OpenEnv 的定位。
在最近的版本中,OpenEnv 已成为一个 RL 环境的互操作层。它的工作是标准化环境的发布、部署以及被 agent 使用的方式。它不会规定奖励如何定义或训练循环如何工作。奖励定义、评分标准以及训练器特定的逻辑,应归属于专门处理这些的库。OpenEnv 是它们都可以插入的通用接口。
在实践中,这意味着:
一个接口,多种环境,所有这些环境都暴露了熟悉的 Gymnasium 风格 API(reset()、step()、state()),运行在客户端/服务器架构上。一个使用 OpenEnv 的训练器可以驱动任何兼容的环境,而无需定制代码。
熟悉的协议和规范的打包方式。环境通过 HTTP 和 WebSocket 等标准协议提供服务,并使用 Docker 打包。MCP 是一等公民,因此 OpenEnv 环境可以立即与 MCP 服务器兼容,并且同一环境在模拟(训练/评估)和生产模式下行为一致。
跨环境库的互操作性。你可以在不同的生态系统(verifiers、harbor 等)中定义和使用环境,并选择你偏好的基础设施和 hub。OpenEnv 是它们底层的部署和接口层,而不是它们的竞争对手。
下一步计划
在接下来的几个月里,我们将专注于将 OpenEnv 从一个快速发展的项目转变为一个可靠的标准:
- 通过 datasets 实现任务集:将环境任务与 Hugging Face datasets 连接起来,使环境和 benchmark 能够干净地组合(RFC 006)。
- 外部奖励:允许在你已使用的任何库中定义奖励,而 OpenEnv 作为部署层(RFC 007)。
- 持续集成框架:对 agent 框架提供一等支持。
- 端到端示例:在 TRL、Unsloth 等工具中提供完整的训练和评估教程。
- 自动验证:衡量环境质量及其对模型学习的贡献。这将为社区提供一种可扩展的方式来评估其环境并提升质量(想想黑客马拉松!)。RFC 008。
参与进来
OpenEnv 在设计上以社区为中心,而且现在还处于早期阶段——预计会有一些粗糙的地方,请帮助我们打磨它。查看代码和 RFC:github.com/huggingface/OpenEnv
感谢所有帮助实现这一转变的人。让我们一起为开源 agentic RL 构建共同的基石。

