如何用Braintrust测试agent成本效率
How to test agent cost-efficiency with Braintrust
Braintrust 在客户支持 agent 场景中评估了六种控制逻辑策略,以“每个已解决请求的成本”为优化目标。结果显示,采用重试后回退(P3)和智能升级(P5)的策略解决率约 93%,每个已解决工单成本分别为 $0.0125 和 $0.0146,比始终使用前沿模型(P0,$0.0190)便宜 23-34%。仅用便宜模型(P1、P2)解决率仅 68-70%,静态规则路由器(P4)成本更高。研究强调,控制逻辑(路由、重试、回退、升级)而非单纯模型替换,是降低生产成本的关键。
2026年6月17日 Izzy Hurley 10分钟
团队需要的不是能一次性产出正确输出的 agent。他们需要的是能在 prompt、模型、工具和数据变化时持续工作的 agent。
这就是为什么 AI 成本控制的最佳方法不是"哪个模型最便宜?",而是"什么样的控制逻辑能以最低成本,仍然产出生产安全的 agent 输出?"
控制逻辑包含关于模型、路由、重试、回退、工具使用和升级的决策。这些决策同时决定了质量和成本。Eval 让你能够实验和迭代,优化这些众多杠杆,最终找到一个良好且成本高效的 agent。
单纯换用更便宜的模型很少能独自解决问题。Token 成本可能下降,但失败会增加,重试会堆积,人工清理可能抵消节省的成本。在生产环境中,成本既取决于模型本身,也取决于模型周围的系统。
近期的产品和研究趋势表明,最大的节省来自路由和升级,而非一次性的模型替换。像 Anthropic 的 Advisor 这样的工具,以产品形式直观地体现了同样的理念。模型选择正成为一个由策略和护栏指导的运行时决策,而非静态设置。

为了研究这一点,我们在一个能暴露问题全貌、同时又易于推理的场景中评估了控制逻辑策略:一个使用工具的客户支持 agent。每个请求都需要模型选择、工具使用、安全判断和最终面向用户的回答。这使得它成为更广泛 agent 系统(包括编码 agent 和内部 copilot)的一个紧凑但现实的代理。
每个请求包含一条客户消息、账户上下文和一组允许使用的工具。Agent 必须决定调用哪些工具,生成正确且语气得当的回复,并避免不安全或不受支持的操作。
我们衡量的是每个已解决请求的成本,而非原始 token 成本。一个请求只有在通过严格的质量关卡后才算解决:正确的工具使用、无危险操作、无未经支持的声明,以及完整、格式良好的回复。这才是真正重要的生产成本。
我们优化的目标
目标很直接:
找到能以最低成本产出生产安全答案的控制逻辑。
在本文中,控制逻辑包括:
- 模型选择
- 工具选择与工具调用验证
- 重试与修复 prompt
- 回退到更强模型
- 基于安全的升级或弃权
我们评估的内容
我们评估了一个真实的客户支持工作流,采用单轮、使用工具的请求。
对于每个请求,agent 必须:
- 决定调用哪些工具
- 起草一份客户回复,以恰当的语气涵盖所需要点
- 避免未经支持的声明和不安全的破坏性操作
我们优化的是每个已解决请求的成本,因为生产成本不仅包括首次补全:
- 主要生成
- 重试与修复
- 回退调用
- 用于质量和安全的 judge 调用
- 工具执行开销
"已解决"的含义
一个请求只有在通过不可协商的关卡后才算解决:
- 工具正确性:当任务需要时,使用所需的工具
- 破坏性工具安全:避免不合理的退款、订阅变更、账户删除或类似操作
- 无未经支持的声明:不要编造账单、账户或政策事实
- 回复质量:涵盖关键点并与客户语气匹配
这就是为什么"始终最便宜"策略在 token 图表上看起来高效,但一旦计入失败、重试和回退,仍然可能很昂贵。
策略
我们测试了六类控制逻辑。
| 策略 | 简述 | 具体做法 |
|---|---|---|
| P0 基线 | 始终用大模型 | 每个请求都使用前沿模型 |
| P1 朴素最便宜 | 始终用最便宜的 | 每个请求都使用 gpt-5-nano |
| P2 同提供商替换 | 用便宜的扫一遍 | 每个请求都使用 gpt-5.4-mini |
| P3 重试后回退 | 重试,然后升级 | 先用 gpt-5.4-mini,重试一次,然后回退到前沿模型 |
| P4 静态风险路由器 | 基于规则的路由 | 将高风险或模糊的工单发送给前沿模型,便宜的工单发送给较小模型 |
| P5 升级预算 | 智能升级 | 从便宜的模型开始,使用重试和轮次预算进行升级,在重复失败或安全相关失败时回退 |
结果是,最强的方法是路由加有保护的升级,而非单一模型替换。
Braintrust 如何提供帮助
Braintrust 是一个 eval 和可观测性基础设施,让你能够将控制逻辑视为一个实验。
对于本次分析,每个策略都作为 agent 工作流在相同的支持工单数据集上运行。Braintrust 端到端地记录了工具调用、重试、回退和输出。然后,我们使用一致的 judge 和相同的安全与质量关卡对每次运行进行评分。
在此基础上,Loop 帮助揭示了最有效的策略以及它们之间的权衡。它按每个案例的成本和每个已解决工单的成本对所有策略进行排名,过滤掉低于 80% 接受标准的策略,并使基于规则的路由器的成本与前沿基线相比变得清晰可见。

Loop 还能让你更快地检查性能前沿,理解为什么一个策略优于另一个,并决定下一步测试什么。
主要结果
最佳策略位于一个既比始终用大模型基线更便宜、质量又更好的区域。
两种升级策略,重试后回退和智能升级,都能解决约 93% 的工单,同时每个工单的成本低于始终使用前沿模型。仅用便宜模型的策略在纸面上更便宜,但它们只能解决约 68-70% 的请求。基于规则的路由器在此设置中质量与大模型相当,但成本更高。
在纯质量方面,升级策略领先,解决率约为 93%。大模型基线和基于规则的路由器约为 85%。仅用便宜模型则远远落后。
成本和质量只有放在一起才有意义。下面的散点图同时绘制了每个策略在这两个轴上的位置——悬停在任意点上可查看其解决率、平均成本和每个已解决工单的成本。你想要的策略位于左上角:高解决率、低成本。
追踪策略随时间的变化
Braintrust 的 Experiments 视图让你能够一目了然地比较策略运行,跟踪调整控制逻辑时指标的变化,并深入查看代表性日志以了解发生了什么变化。下面的运行显示在 dev 分片上,因此其每个指标的分数反映的是该分片,而非混合后的总体数字。

这种方法很有帮助,因为最佳策略很少能一次猜对。你需要一个地方来比较相同数据上的策略,检查失败,并在每次更改后重新运行实验。
成本因工单而异
平均值掩盖了分布情况。
升级策略在大多数工单上保持低成本,仅在那些实际升级的子集上花费更多。这意味着平均成本看起来不错,但分布能告诉你更多关于策略行为的信息。

分布很重要,因为它暗示了策略成功或失败的原因。升级策略集中在平均值附近,只有少数异常值。基于规则的路由器则持续更昂贵,这表现为更宽的分布。
质量仍然在哪里出问题
没有一种策略是完美的,因此下一个问题是失败来自哪里。
Loop 帮助揭示了跨策略的失败模式。

大多数失败集中在那些最依赖便宜模型的策略上,尤其是 P1 和 P2。当工具调用失败时,这些 agent 更可能生成未经支持的文本回复,这就是为什么未经支持的声明如此频繁出现。在质量方面,许多便宜模型的失败源于关键点覆盖率低:模型使用正确工具和语气的频率高于预期,但遗漏了太多必要步骤,无法通过回复质量阈值。我们最强的两个策略 P3 和 P5 以类似的方式失败,这表明下一次迭代应更少关注模型选择,更多关注 prompt 改进、更丰富的上下文或额外的工具。静态风险路由器大多反映了其委托策略的失败模式,这正是手工编写路由规则所预期的结果。
查看每个策略下相同工单的表现,可以显示哪些案例本质上是困难的,哪些只在特定策略下失败。

像这样的持续失败正是好的 eval 应该揭示的。它们显示了系统更改可以在哪些方面显著提高质量,以及在哪些方面为更强的模型付费实际上是值得的。
最重要的数字:每个已解决工单的成本
每个已解决工单的成本是最诚实的效率数字,因为它捕捉了解决客户问题的真实代价。你可以通过将总支出除以实际解决良好的工单数来计算。
在通过高质量标准的策略中,重试后回退约为 $0.0125,智能升级约为 $0.0146,比始终用大模型的约 $0.0190 便宜约 23-34%。

仅用便宜模型的策略看起来仍然便宜,但它们解决的工单要少得多。如果你的质量标准很重要,它们就不是最佳选择。
每月 10,000 个工单时的表现
在每月 10,000 个工单的情况下,智能升级以约 93% 的解决率处理该量级,每月成本约为 $135,而始终用大模型策略以约 85% 的解决率,每月成本约为 $161。
仅用便宜模型的策略成本更低,约为每月 $42-60,但它们只能解决约 68-70% 的工单。在此实验中,基于规则的路由器是高质量选项中成本最高的。

使用你自己的量级假设试试看:
这在实践中意味着什么
- 智能升级胜出。 它在降低总成本的同时,提高了相对于始终用大模型基线的质量。
- 默认用便宜的是虚假经济。 如果系统解决的请求少得多,更低的 token 支出也无济于事。
- 静态规则不如自适应升级那样具有泛化能力。 手工调优的路由器在熟悉案例上尚可,但在新案例上更脆弱。
如果你想在不牺牲质量的情况下降低 AI 成本,正确的分析单位不是 token 价格。而是每个已解决请求的成本,根据你的产品实际需要的质量标准来衡量。
Braintrust 为你提供了直接进行这项工作的基础设施:记录工作流、定义 eval、在相同轨迹上比较策略,并使用 Loop 检查重要的失败和权衡。
有关如何将真实生产失败转化为更好的 agent 行为的更多信息,请参阅从生产数据构建 eval 的研讨会。
如果你想测试自己的路由和升级策略,试试 Braintrust 或预约演示。