评估GitHub Copilot代理框架在多种模型与任务中的性能与效率
Evaluating performance and efficiency of the GitHub Copilot agentic harness across models and tasks
GitHub Copilot 智能体框架作为Copilot SDK的共享组件,驱动CLI、应用、代码审查等体验。该框架在SWE-bench Verified、TerminalBench等基准测试中,使用Claude Sonnet 4.6、Claude Opus 4.7、GPT-5.4和GPT-5.5等模型,与Claude Code和Codex CLI等模型供应商框架对比,实现了相当的任务解决率,同时在多数配置中token消耗更低。框架支持GPT、Claude、Gemini等20多个模型及自动模型选择,并具备跨模型批评等能力。
虽然模型提供了原始智能,但框架(harness)决定了这种智能被应用的效率。GitHub Copilot 智能体框架是 GitHub Copilot SDK 的一个共享组件,它为 GitHub Copilot CLI、GitHub Copilot 应用、Copilot 代码审查以及 GitHub 和 Microsoft 上的各种体验提供支持。改进了框架,所有应用场景都会受益。GitHub Copilot 智能体框架驱动着 GitHub Copilot 的体验。工具、上下文和工作流程都由该框架编排。一个框架应该对开发者来说快速、token 高效且可预测。这正是我们设计 GitHub Copilot 智能体框架的目标。在本文中,我们将展示数据,说明 GitHub Copilot 智能体框架在广泛的智能体软件工程任务中的效率和性能。
我们正在进行的更多优化 阅读更多关于我们在上下文处理和模型路由方面的最新优化,以充分利用每个 token。我们还分享了更多关于委派(delegation)的实验和优化,以及它如何让今天的开发者受益。
我们如何通过基准测试进行迭代 我们通过结合公开和内部开发的基准测试,持续评估 GitHub Copilot 智能体框架的能力和效率。我们的公开基准测试包括行业标准,而几个内部基准测试则源自 GitHub 和 Microsoft 内部的大型代码库。我们辅以真实世界的指标和在线实验,以确保我们了解该框架在受控环境中的性能,以及它对智能体问题解决和任务完成的实际影响。
我们尽可能控制变量,以评估 GitHub Copilot 框架与模型提供商框架的性能对比:使用相同的模型、相同的基准测试任务,并在上下文窗口、推理努力(reasoning efforts)、工具选择和 MCP 服务器上进行归一化处理。以下是我们跟踪的基准测试子集的最新结果,涉及四个领先模型:Claude Sonnet 4.6、Claude Opus 4.7、GPT-5.4 和 GPT-5.5:
| 基准测试 | 领域 | 目的 |
|---|---|---|
| SWE-bench Verified | 来自开源 Python 仓库的 500 个人工验证的 bug 修复任务 | 编码智能体的既定行业标准基准测试 |
| SWE-bench Pro | 更困难、多步骤的工程任务,需要更深入的推理和更广泛的代码更改 | 更好地反映复杂的真实世界软件工程工作 |
| SkillsBench | 智能体使用技能解决问题的效率 | 评估可扩展性、技能使用和触发能力 |
| TerminalBench | 智能体在基于终端的任务上的表现 | 衡量开发者使用的命令行工作流程中的有效性 |
| Win-Hill | 在 Windows 容器内运行任务的内部基准测试 | 验证性能是否跨操作系统和环境通用 |
在整个过程中,我们将 GitHub Copilot CLI 与原生搭载这些模型的模型供应商框架进行比较:Claude Code(用于 Sonnet 4.6 和 Opus 4.7)和 Codex CLI(用于 GPT-5.4 和 GPT-5.5)。
Token 效率 在固定模型和任务的情况下,跨多个基准测试结果,GitHub Copilot 框架实现了与其他模型供应商框架相当的任务完成率,同时在大多数配置中显示出更低的 token 消耗。
Token 效率:GitHub Copilot CLI 与其他模型供应商框架对比
任务解决率 Token 效率只有在工作真正完成时才重要。当与固定模型和基准测试任务一起使用时,GitHub Copilot 智能体框架在这些基准测试中的任务解决率与模型供应商框架相当。这确保了底层模型的全部潜力得以发挥,同时还提供了多模型灵活性、token 效率以及内存和上下文能力。
任务解决率:GitHub Copilot CLI 与模型供应商框架对比
这些结果反映了有效的对等性,因为任一方向的差异都在由于模型的随机性而导致的方差范围内,这使得跨框架的性能相当。
TerminalBench:Token 效率、任务完成率和方差 为了持续改进 GitHub Copilot 智能体框架在任务完成率和 token 效率方面的表现,我们定期跨基准测试进行深入分析。以下是 TerminalBench 2.0 上方差分析的一个示例,它不仅突出了 GitHub Copilot 在任务完成率和 token 效率方面的优势,还显示了此类基准测试固有的运行间方差。
解决率与每任务成本。越靠左上方越好:解决更多,花费更少。每个标记代表 TerminalBench 2.0 上的一个智能体和模型配置,垂直轴为解决率,水平轴为每任务的美元成本。每个点周围的阴影椭圆显示了 ±1σ 的运行间分布,展示了每个配置在不同运行之间的变化程度。
三点值得注意:
- GitHub Copilot 的智能体框架在我们评估的配置中,在任务完成率和每任务成本方面与其他智能体相当或领先。紫色(Copilot)标记及其同模型竞争对手在几乎所有模型的两个轴上均位于重叠的椭圆内——差异在运行间方差范围内。Copilot 在完成率上从未低于竞争对手,在成本上也从未高于竞争对手。
- 运行间变异性。我们每个智能体-模型组合至少运行了五次。椭圆标记了这些运行的 1σ 分布;图表中更紧密的椭圆意味着更可重复的结果,而更宽的椭圆则显示结果在成本和任务完成率上每次运行波动更大。
- GitHub Copilot 模型选择的优势:图表显示了一个真实的权衡:GPT 模型(左侧)提供了最佳价值:以最低的成本实现强大的解决率。Claude Opus(右上)以溢价达到了最高的解决率。GitHub Copilot 将两者都摆在桌面上,因此您可以为每个任务选择效率或峰值质量。
一个框架,多种模型 GitHub Copilot 智能体框架支持 GPT、Claude、Gemini 和 MAI 系列中的 20 多个前沿模型,外加自带密钥(bring your own key)用于开源和本地模型。您可以为每个任务的能力和成本概况选择正确的模型,或者让自动模型选择(Auto model selection)为您选择,平衡任务意图和模型健康以优化 token 效率。
多模型架构还解锁了模型供应商框架根本无法提供的框架级能力。例如,Rubber Duck 使用跨模型系列批评(cross-model-family critique),其中一个模型审查另一个模型的工作,以改善超出任何单个模型单独产生的结果。
结论 基准测试只是众多信号中的一个。我们不断努力在基准测试、真实世界使用指标和在线实验中提高质量,同时推动高效地充分利用每个 token。GitHub Copilot 在多个配置中使用更少的 token 实现了与领先模型供应商框架相当的任务解决率,并且通过其多模型架构不会将您锁定在单一模型上。对于开发者来说,这意味着您可以获得可比较的任务完成率,同时降低 token 成本,并且仍然可以选择最适合您任务的模型。
亲自尝试 使用您选择的模型尝试 GitHub Copilot,在您每天执行的任务上比较不同方法,看看不同模型和智能体策略在您的环境中表现如何。
了解更多关于:
- GitHub Copilot CLI
- GitHub Copilot 应用
- GitHub Copilot SDK
同一个智能体框架为这些体验提供支持。我们正在继续提高其质量、效率和灵活性。
方法论 为了使比较尽可能受控和可重现,我们在模型、任务和环境之间使用等效设置运行每个智能体。所有运行都有两小时的超时时间。所有智能体以非交互式单轮模式运行,禁用 Web 工具,并允许所有工具。
- TerminalBench2 分析:为智能体启用默认设置,推理努力设置为中等(例如,为 Claude Code 启用了工具搜索,Copilot CLI 使用 github-mcp-server)。Codex 和 Claude Code 使用直接的 Anthropic 和 OpenAI 端点。为确保完整可靠的结果,任何缺失数据或基础设施相关的失败都被重新运行,直到所有 89 个 TerminalBench2 任务都产生结果。模型生成的错误被保留,并未从分析中排除。每个模型在五次独立运行中进行评估,Copilot 在两个独立的评估批次中进行测试,以便与 Claude Code 和 Codex 进行比较。
- 所有基准测试:所有智能体-模型对都归一化到相同的上下文窗口大小、相同的 prompt token 限制、推理努力(中等)和设置——无工具搜索,无 MCP 服务器。保留框架的默认内置工具。为了确保公平比较,所有智能体的基础设施相关异常和网络访问影响均从基准测试中排除。为了减少运行间变异性对较小基准测试的影响……
本文《评估 GitHub Copilot 智能体框架跨模型和任务的性能与效率》最初出现在 GitHub 博客上。