Braintrust · 官方

如何用Braintrust测试agent成本效率

How to test agent cost-efficiency with Braintrust

二〇二六年六月三十日 · 英文原文

Braintrust 在客户支持 agent 场景中评估了六种控制逻辑策略,以“每个已解决请求的成本”为优化目标。结果显示,采用重试后回退(P3)和智能升级(P5)的策略解决率约 93%,每个已解决工单成本分别为 $0.0125 和 $0.0146,比始终使用前沿模型(P0,$0.0190)便宜 23-34%。仅用便宜模型(P1、P2)解决率仅 68-70%,静态规则路由器(P4)成本更高。研究强调,控制逻辑(路由、重试、回退、升级)而非单纯模型替换,是降低生产成本的关键。

2026年6月17日 Izzy Hurley 10分钟

团队需要的不是能一次性产出正确输出的 agent。他们需要的是能在 prompt、模型、工具和数据变化时持续工作的 agent。

这就是为什么 AI 成本控制的最佳方法不是"哪个模型最便宜?",而是"什么样的控制逻辑能以最低成本,仍然产出生产安全的 agent 输出?"

控制逻辑包含关于模型、路由、重试、回退、工具使用和升级的决策。这些决策同时决定了质量和成本。Eval 让你能够实验和迭代,优化这些众多杠杆,最终找到一个良好且成本高效的 agent。

单纯换用更便宜的模型很少能独自解决问题。Token 成本可能下降,但失败会增加,重试会堆积,人工清理可能抵消节省的成本。在生产环境中,成本既取决于模型本身,也取决于模型周围的系统。

近期的产品和研究趋势表明,最大的节省来自路由和升级,而非一次性的模型替换。像 Anthropic 的 Advisor 这样的工具,以产品形式直观地体现了同样的理念。模型选择正成为一个由策略和护栏指导的运行时决策,而非静态设置。

图 1:Anthropic Advisor 路由截图

为了研究这一点,我们在一个能暴露问题全貌、同时又易于推理的场景中评估了控制逻辑策略:一个使用工具的客户支持 agent。每个请求都需要模型选择、工具使用、安全判断和最终面向用户的回答。这使得它成为更广泛 agent 系统(包括编码 agent 和内部 copilot)的一个紧凑但现实的代理。

每个请求包含一条客户消息、账户上下文和一组允许使用的工具。Agent 必须决定调用哪些工具,生成正确且语气得当的回复,并避免不安全或不受支持的操作。

我们衡量的是每个已解决请求的成本,而非原始 token 成本。一个请求只有在通过严格的质量关卡后才算解决:正确的工具使用、无危险操作、无未经支持的声明,以及完整、格式良好的回复。这才是真正重要的生产成本。

我们优化的目标

目标很直接:

找到能以最低成本产出生产安全答案的控制逻辑。

在本文中,控制逻辑包括:

我们评估的内容

我们评估了一个真实的客户支持工作流,采用单轮、使用工具的请求。

对于每个请求,agent 必须:

我们优化的是每个已解决请求的成本,因为生产成本不仅包括首次补全:

"已解决"的含义

一个请求只有在通过不可协商的关卡后才算解决:

这就是为什么"始终最便宜"策略在 token 图表上看起来高效,但一旦计入失败、重试和回退,仍然可能很昂贵。

策略

我们测试了六类控制逻辑。

策略 简述 具体做法
P0 基线 始终用大模型 每个请求都使用前沿模型
P1 朴素最便宜 始终用最便宜的 每个请求都使用 gpt-5-nano
P2 同提供商替换 用便宜的扫一遍 每个请求都使用 gpt-5.4-mini
P3 重试后回退 重试,然后升级 先用 gpt-5.4-mini,重试一次,然后回退到前沿模型
P4 静态风险路由器 基于规则的路由 将高风险或模糊的工单发送给前沿模型,便宜的工单发送给较小模型
P5 升级预算 智能升级 从便宜的模型开始,使用重试和轮次预算进行升级,在重复失败或安全相关失败时回退

结果是,最强的方法是路由加有保护的升级,而非单一模型替换。

Braintrust 如何提供帮助

Braintrust 是一个 eval 和可观测性基础设施,让你能够将控制逻辑视为一个实验。

对于本次分析,每个策略都作为 agent 工作流在相同的支持工单数据集上运行。Braintrust 端到端地记录了工具调用、重试、回退和输出。然后,我们使用一致的 judge 和相同的安全与质量关卡对每次运行进行评分。

在此基础上,Loop 帮助揭示了最有效的策略以及它们之间的权衡。它按每个案例的成本和每个已解决工单的成本对所有策略进行排名,过滤掉低于 80% 接受标准的策略,并使基于规则的路由器的成本与前沿基线相比变得清晰可见。

图 2:所有六种策略的 Loop 成本效率对比

Loop 还能让你更快地检查性能前沿,理解为什么一个策略优于另一个,并决定下一步测试什么。

主要结果

最佳策略位于一个既比始终用大模型基线更便宜、质量又更好的区域。

两种升级策略,重试后回退智能升级,都能解决约 93% 的工单,同时每个工单的成本低于始终使用前沿模型。仅用便宜模型的策略在纸面上更便宜,但它们只能解决约 68-70% 的请求。基于规则的路由器在此设置中质量与大模型相当,但成本更高。

在纯质量方面,升级策略领先,解决率约为 93%。大模型基线和基于规则的路由器约为 85%。仅用便宜模型则远远落后。

成本和质量只有放在一起才有意义。下面的散点图同时绘制了每个策略在这两个轴上的位置——悬停在任意点上可查看其解决率、平均成本和每个已解决工单的成本。你想要的策略位于左上角:高解决率、低成本。

追踪策略随时间的变化

Braintrust 的 Experiments 视图让你能够一目了然地比较策略运行,跟踪调整控制逻辑时指标的变化,并深入查看代表性日志以了解发生了什么变化。下面的运行显示在 dev 分片上,因此其每个指标的分数反映的是该分片,而非混合后的总体数字。

图 3:比较策略运行的 Experiments 视图,dev 分片

这种方法很有帮助,因为最佳策略很少能一次猜对。你需要一个地方来比较相同数据上的策略,检查失败,并在每次更改后重新运行实验。

成本因工单而异

平均值掩盖了分布情况。

升级策略在大多数工单上保持低成本,仅在那些实际升级的子集上花费更多。这意味着平均成本看起来不错,但分布能告诉你更多关于策略行为的信息。

图 4:按策略划分的成本分布

分布很重要,因为它暗示了策略成功或失败的原因。升级策略集中在平均值附近,只有少数异常值。基于规则的路由器则持续更昂贵,这表现为更宽的分布。

质量仍然在哪里出问题

没有一种策略是完美的,因此下一个问题是失败来自哪里。

Loop 帮助揭示了跨策略的失败模式。

图 5:P0–P5 跨策略失败总结

大多数失败集中在那些最依赖便宜模型的策略上,尤其是 P1 和 P2。当工具调用失败时,这些 agent 更可能生成未经支持的文本回复,这就是为什么未经支持的声明如此频繁出现。在质量方面,许多便宜模型的失败源于关键点覆盖率低:模型使用正确工具和语气的频率高于预期,但遗漏了太多必要步骤,无法通过回复质量阈值。我们最强的两个策略 P3 和 P5 以类似的方式失败,这表明下一次迭代应更少关注模型选择,更多关注 prompt 改进、更丰富的上下文或额外的工具。静态风险路由器大多反映了其委托策略的失败模式,这正是手工编写路由规则所预期的结果。

查看每个策略下相同工单的表现,可以显示哪些案例本质上是困难的,哪些只在特定策略下失败。

图 6:P0–P5 策略下每个工单的通过与失败情况

像这样的持续失败正是好的 eval 应该揭示的。它们显示了系统更改可以在哪些方面显著提高质量,以及在哪些方面为更强的模型付费实际上是值得的。

最重要的数字:每个已解决工单的成本

每个已解决工单的成本是最诚实的效率数字,因为它捕捉了解决客户问题的真实代价。你可以通过将总支出除以实际解决良好的工单数来计算。

在通过高质量标准的策略中,重试后回退约为 $0.0125智能升级约为 $0.0146,比始终用大模型的约 $0.0190 便宜约 23-34%

图 7:每个已解决请求的成本

仅用便宜模型的策略看起来仍然便宜,但它们解决的工单要少得多。如果你的质量标准很重要,它们就不是最佳选择。

每月 10,000 个工单时的表现

在每月 10,000 个工单的情况下,智能升级以约 93% 的解决率处理该量级,每月成本约为 $135,而始终用大模型策略以约 85% 的解决率,每月成本约为 $161

仅用便宜模型的策略成本更低,约为每月 $42-60,但它们只能解决约 68-70% 的工单。在此实验中,基于规则的路由器是高质量选项中成本最高的。

图 8:每月 10,000 个工单的月度成本

使用你自己的量级假设试试看:

这在实践中意味着什么

  1. 智能升级胜出。 它在降低总成本的同时,提高了相对于始终用大模型基线的质量。
  2. 默认用便宜的是虚假经济。 如果系统解决的请求少得多,更低的 token 支出也无济于事。
  3. 静态规则不如自适应升级那样具有泛化能力。 手工调优的路由器在熟悉案例上尚可,但在新案例上更脆弱。

如果你想在不牺牲质量的情况下降低 AI 成本,正确的分析单位不是 token 价格。而是每个已解决请求的成本,根据你的产品实际需要的质量标准来衡量。

Braintrust 为你提供了直接进行这项工作的基础设施:记录工作流、定义 eval、在相同轨迹上比较策略,并使用 Loop 检查重要的失败和权衡。

有关如何将真实生产失败转化为更好的 agent 行为的更多信息,请参阅从生产数据构建 eval 的研讨会


如果你想测试自己的路由和升级策略,试试 Braintrust预约演示

译自 Braintrust · 官方 · 录于 二〇二六年六月三十日