Orchard:可扩展智能体AI的开放框架
Orchard: An open framework for scalable agentic AI
Orchard是微软研究院发布的开源框架,用于可扩展代理型AI研究,核心为Orchard Env——一个基于Kubernetes的可复用环境服务,支持软件工程、网页导航和个人助理代理,并可直接在Codex、OpenClaw、ZeroClaw等真实框架内训练。其三个训练方案中,Orchard-SWE在SWE-bench Verified上达69.7%(价值模型重排序后73.0%),仅用约30亿活跃参数;Orchard-GUI在多个网页基准上平均68.4%;Orchard-Claw在Claw-Eval上达59.6%。项目同时发布训练数据和评估方法。
概览:Orchard 是一个开源框架,旨在支持可扩展且成本高效的代理型 AI 研究,其核心是 Orchard Env,一个可复用的环境服务,用于跨任务领域训练和评估代理。同一 Orchard 基础设施支持软件工程、网页导航和个人助理代理,并可直接在 Codex、OpenClaw 和 ZeroClaw 等真实部署框架内训练它们,使研究人员能够跨任务复用环境、数据管道和评估工作流。Orchard-SWE、Orchard-GUI 和 Orchard-Claw 展示了相对较小的开放权重模型在复杂现实任务上也能取得强劲表现。例如,Orchard-SWE 在 SWE-bench Verified 上达到 69.7%——使用价值模型重排序后为 73.0%——仅使用约 30 亿活跃参数,接近使用超过 10 倍规模模型的领先系统。除了模型和工作流,该项目还发布了训练数据和评估方法,旨在帮助更广泛的研究社区构建和研究开放代理系统。
人工智能正迅速从静态问答转向自主代理,这些代理能够在复杂的多步骤环境中进行规划、推理和行动。这些系统可以修复复杂代码库中的错误,代表用户浏览网页,并管理涉及日历和电子邮件的工作流。
尽管人们对代理型 AI 的能力感到兴奋,但研究社区面临着一个持续的瓶颈。构建最先进的代理系统通常需要专有基础设施,包括自定义沙箱、封闭训练管道和专有数据集,大多数研究人员和从业者无法访问或复现这些资源。为弥补这一差距,我们推出了 Orchard(在新标签页中打开),一个用于可扩展代理建模的开源框架。Orchard 的核心是 Orchard Env,一个轻量级的 Kubernetes 环境,提供可复用的隔离组件,用于大规模运行和构建代理——从收集训练数据到强化学习 rollout 和评估。
与许多现有框架不同,Orchard Env 设计为无需修改即可支持不同的代理系统和任务类型。同一服务可以支持软件工程代理、网页浏览代理和跨领域的个人助理代理。为展示这种方法,我们发布了三个特定领域的训练方案——Orchard-SWE、Orchard-GUI 和 Orchard-Claw(在新标签页中打开)。我们还发布了用于构建它们的训练数据和评估方法。
焦点:AI 驱动的体验 Microsoft research copilot experience 通过我们的 AI 驱动体验了解更多关于 Microsoft 的研究 立即开始 在新标签页中打开
跨任务类型扩展的环境层 Orchard 的核心思想是运行时环境应作为独立的、可复用的服务,而不是嵌入特定训练框架中的基础设施。Orchard Env 的 Kubernetes 基础使其能够并行创建、管理和移除数千个隔离组件。该系统设计为支持编码、网页浏览、工具使用等任务,并支持不同的代理系统以及训练和评估过程的各个阶段,包括数据蒸馏和强化学习 rollout。这种灵活性使 Orchard 在研究规模上具有实用性。团队可以引入新的基准、代理系统或训练算法,而无需从头重建底层基础设施。
Orchard 还使得在任何框架内训练代理成为可能。当今最强大的代理很少作为裸模型运行。它们通过复杂的框架——如 Claude Code、Codex 和 OpenClaw——运行,这些框架管理多轮推理、工具使用和与外部系统的连接。开放训练工具通常无法处理这些有状态的、多进程的框架,迫使研究人员在简化的替代品上训练,然后在真实环境中部署,这造成了不匹配。Orchard 弥合了这一差距:一个轻量级代理记录框架自身的模型调用作为训练数据,而每个 rollout 在其自己的容器中运行,因此代理可以直接在其将要部署的框架中端到端训练——OpenClaw、Codex、ZeroClaw 或其他——并跨多个框架。
Orchard-SWE:推进开源软件工程代理 软件工程是自主代理最苛刻的场景之一。它需要对真实代码库进行多步推理、工具使用以及从错误中恢复的能力。Orchard-SWE 是我们针对该领域的训练工作流。它基于 Mini-SWE-Agent 框架构建,旨在自主解决软件工程任务,并在广泛使用的 SWE-bench Verified 基准上评估,该基准测试模型导航、诊断和修复真实代码库的能力。为训练该系统,我们从两个先进的开放权重模型(MiniMax-M2.5 和 Qwen3.5-397B)中蒸馏了 107,000 次代理交互,涵盖广泛的 GitHub Issues。训练过程使用信用分配监督微调:不是丢弃代理未能完全解决问题的尝试,而是从这些部分尝试的有效部分中学习,扩展了模型可用的有用训练数据量。
接下来是强化学习,但其反馈是稀疏的——代理通常只知道其最终补丁是否通过隐藏测试。我们从 Balanced Adaptive Rollout 开始,旨在充分利用这些罕见的成功信号,然后添加两种“密集奖励”技术以提供更丰富的指导:策略内蒸馏,其中更强的教师模型逐步评分代理的决策;以及过程奖励模型,其中 AI 评判者奖励合理的解决问题过程——编写复现错误的测试、验证修复、检查现有行为是否仍然有效——而不论最终测试是否通过。
最后,我们在过去的 rollout 上训练一个价值模型来对候选解决方案进行重排序。强化学习生成许多通常被丢弃的实践轨迹;相反,来自 20 个先前实验的轨迹训练了一个紧凑的 40 亿参数价值模型,能够识别高质量解决方案,在解决问题时对多个候选答案进行评分并选择最佳。这些技术共同将 Orchard-SWE 从 SWE-bench Verified 上的 61.4% 基线提升到使用 Balanced Adaptive Rollout 的 69.1% 和使用密集奖励技术的 69.7%——在相似规模(约 30 亿活跃参数)的开源模型中达到新的最先进水平——使用价值模型重排序后提升至 73%,接近超过 10 倍规模的领先系统,如图 1 所示。
Orchard-GUI:用于真实网页任务的轻量级浏览器代理 网页导航提出了不同的挑战。代理必须解释视觉布局、与动态界面交互,并完成仅用自然语言描述的开放式任务。Orchard-GUI 使用相对较少的监督训练了一个 40 亿参数的视觉语言模型作为浏览器代理:400 个蒸馏演示结合 2,200 个开放式训练任务。尽管训练数据有限,生成的模型在多个网页导航基准上取得了强劲结果:WebVoyager 上 74.1%,Online-Mind2Web 上 67.0%,DeepShop 上 64.0%,平均 68.4%,如图 1 所示。
图 1. 性能比较。左:Orchard-SWE(35B-A3B,约 3B 活跃)在 SWE-bench Verified 上达到 69.7%——使用价值模型重排序后为 73%——匹配超过 10 倍规模的领先系统。右:Orchard-GUI(4B)在 WebVoyager、Online-Mind2web 和 DeepShop 上平均成功率达到 68.4%,使其成为最强的开源 GUI 代理,同时与 OpenAI 和 Google 的专有系统保持相当。
这些结果使 Orchard-GUI 成为迄今为止最强的开源网页代理之一,同时与更大的专有模型保持竞争力。结果还表明,使用正确的训练方法和环境,小型开放模型可以在真实网页任务上表现良好。
Orchard-Claw:面向日常生产力的个人助理代理 许多最具影响力的代理应用涉及日常生产力任务,包括阅读和起草电子邮件、管理日历、搜索信息以及跨工具协调。Orchard-Claw 专注于个人助理任务,仅使用 200 个合成任务训练代理。在 Claw-Eval(一个涵盖现实生产力工作流的基准)上评估时,它在最多三次尝试的情况下成功完成 59.6% 的任务。与更强的 ZeroClaw 代理系统配对时,这一比例提升至 73.9%。由于 Orchard 可以直接在真实部署框架内训练代理,Orchard-Claw 在多个框架上训练——包括 ReACT、ZeroClaw、OpenClaw 和 Codex——而不是单一的简化循环。在这些真实框架内训练显著提高了代理的可靠性;例如,在 Codex 框架下,其成功率从未训练模型的 18.6% 上升到 Orchard 训练后的 51.5%。
图 2. Orchard 框架概述。Orchard Env(中心)是一个轻量级的 Kubernetes 原生环境服务,提供共享能力,如沙箱管理、命令执行、文件访问、网络控制、REST API 和代理集成。它支持一系列任务环境(底行),并用于三个任务领域(顶行):Orchard-SWE(软件工程)、Orchard-GUI(浏览器导航)和 Orchard-Claw(AI 个人助理)。
影响与未来展望 Orchard 的结果强化了一个更广泛的观点:环境层很重要。通过使底层基础设施开放、轻量且可复用,Orchard 降低了代理型 AI 研究的成本。团队不再需要从头构建自定义隔离环境或依赖专有云服务。同一 Orchard Env 可用于生成训练数据、运行强化学习 rollout 和评估最终模型,而无需每次重建系统。
展望未来,我们将复用训练经验视为实现累积代理学习的有前景方向。不是在一次训练运行结束后丢弃轨迹,而是将其视为持久资产——例如,将其蒸馏为可复用的价值模型。这使得代理经验能够随时间累积,让每一代新代理继承并扩展先前代理获得的知识,而不是从头开始。
Orchard-GUI 展示的数据效率表明,可以训练更大规模的网页代理,而无需大量手动创建的训练数据。通过发布完整的 Orchard 技术栈,包括环境服务、训练管道和训练数据集,我们希望帮助更广泛的研究社区更快地构建更强大的开放代理。
致谢 我们感谢 Microsoft Research 及合作机构的团队对 Orchard 的贡献,以及开源社区,其基准和工具使这项研究成为可能。
在新标签页中打开
这篇题为“Orchard:用于可扩展代理型 AI 的开放框架”的文章最初出现在 Microsoft Research 上。