更多算力,更多能力:为何AI agent评估需考虑测试时算力
More compute, more capability: Why AI agent evaluations need to account for test-time compute
AISI评估科学团队在2026年3月发布研究,表明固定预算评估会系统性低估前沿AI智能体能力。团队在网络安全、软件工程、数学等多项benchmark上,对前沿模型进行从100万到1亿Token的测试时计算预算扫描。结果显示:模型能力是随测试时计算增长的曲线而非单一分数;任务所需算力与熟练人类完成时间成正比;较新模型从额外算力中获益更多,固定预算下能力差距被掩盖。AISI正据此调整评估方法,在多个预算下测试并报告能力曲线。
随着AI智能体被赋予更多自主权并承担更艰巨的任务,低估其能力所带来的后果也愈发严重。目前大多数智能体评估仍将能力简化为单一数字:基准测试分数、通过/未通过,或智能体能完成的任务时长。这个数字隐藏了一个关键的设计选择:智能体在停止前被允许消耗多少算力。
2026年3月,AISI发布结果,表明适度的算力限制低估了模型在网络任务上的能力,并且同样的限制现在可能错过了实质性的进步。此后,我们的评估科学团队在多个智能体基准测试(涵盖网络安全、软件工程、数学、学术任务和医疗保健)中,以较大的测试时预算对前沿模型进行了测试。
我们发现,固定预算的评估可能会系统性地低估前沿智能体的能力,尤其是对于较新的模型。首先,智能体在执行任务时可以消耗的算力——即“测试时计算”——是其在许多基准测试中观测到能力的主要驱动因素。其次,任务所需的算力随着熟练人类完成该任务所需时间的增长而增长,因此最长、最艰巨的任务会最先被固定预算截断。最后,我们发现较新的模型从额外算力中获益更多。随着模型改进,固定预算得分与更高预算能力之间的差距可能会扩大。
这些测量效应具有实际影响。受限预算的得分可能使模型比较不公平,导致决策者低估智能体能力,并掩盖风险的真正规模。随着智能体的改进,除非我们的测量方法能反映能力曲线,否则这一盲点只会越来越大。
我们做了什么
测试时计算可以通过两种不同的方式提升性能。Token可用于不同类型的工作:执行任务步骤或支持推理、规划和检查解决方案。相同的算力也可以串行分配,即通过一个长轨迹让智能体探索和修正错误;或并行分配,即通过几次较短的尝试来提高其中一次成功的概率(图1)。
额外算力的去向 示意图
更多的测试时计算要么带来更长的串行工作流,要么带来更多的并行尝试。过早停止可能会截断本可解决问题的串行步骤或新的尝试。
图1. 测试时计算如何塑造性能。 给定的计算预算可以用于一次长而深的串行尝试(上图),也可以分散到几次较短的独立尝试中,然后汇总评分(下图)。串行分配为智能体提供了扩展工作循环的空间,而并行分配则提高了至少一次运行成功的几率。移动预算截止点可以展示这些选择如何改变测量到的性能。
我们没有在固定预算下对每个模型进行一次评分,而是将Token预算从低到高进行扫描,并测量性能如何变化。随着预算增长,我们追踪了四个量:整体成功率、可靠性、效率以及模型能触及的最难任务。
我们还分析了单个任务层面的结果,而不仅仅是整个基准测试的分数。在相同任务上比较连续几代模型,可以展示能力曲线如何随模型改进而移动。
我们的发现
模型能力不是一个单一分数,而是一条关于测试时计算的曲线。
一个AI智能体在一组任务上的表现最好被理解为一条_能力曲线_,它描绘了随着计算预算增长,其分数如何变化(图2)。如果评估停止时曲线仍在上升,那么报告的分数只是一个下限,而非模型能力的天花板。
更多测试时计算,更强能力 示意图
随着AI智能体被给予更多算力来执行任务,其表现会提升。随着较新模型更善于利用测试时计算,模型之间的能力差距会扩大。
前沿模型 近期模型 较旧模型
实心点:预算内最难的任务空心点:高算力下最难的任务
图2. 每条曲线说明了随着测试时计算增加,测量到的能力如何变化。将预算从低提高到高,可以解锁更难的任务,并扩大较弱模型与较强模型之间的差距。灰色区域是当预算过早停止智能体时仍隐藏的能力。数据仅为示意。
在AISI的狭义网络任务套件中,我们发现模型成功率随每个任务的算力预算稳步上升(图3)。大约8%的任务只有在预算达到1000万Token以上时才被解决,有些任务甚至需要高达5000万Token。在较小的预算下,这些成功将不可见。最新模型在1亿Token以上的预算下达到了更高的分数。

Tweet This Image
Download Image
图3. 每个面板绘制了针对基准测试(Cyber CTFs = AISI的狭义网络任务套件)中所有任务汇总的累积成功率,与消耗的总Token数之间的关系。x轴采用对数刻度,因此每个标记代表Token数增加10倍。来源.
同样的模式也出现在公开基准测试中。将总Token预算从100万增加到1000万,在软件工程任务(TerminalBench 2.0, SWE-Bench Pro)上性能提升了约25%,在数学和学术任务(Humanity's Last Exam,最高500万Token)上提升了约22%。在TerminalBench上,即使我们将Token预算提高到公开评估通常报告的10倍,性能仍在持续提升。¹
人类完成任务所需时间越长,智能体需要的算力就越多。
在AISI的网络安全任务和METR的软件工程任务(图4)中,我们发现智能体解决任务所需的算力与熟练人类完成该任务所需的时间成比例增长。² 即使对于每个任务最经济的成功运行,这种模式也成立,这表明下限是由任务所需的工作量决定的,而不仅仅是算力的低效使用。这有助于解释为什么基准测试曲线可以随着预算增加而平稳上升:每个更大的预算都能触及另一批具有更高算力需求的任务。
我们目前仅在网络和软件工程任务中测试了这一点;趋势周围的变异显著,且人类时间作为任务难度的代理指标并不完美。随着模型改进,或者在工作可以更容易压缩的领域,这个下限可能会移动。但对于当今这些领域的智能体而言,人类任务时间跨度是预测观察任务成功所需算力的有用指标。

Tweet This Image
Download Image
图4. 每个点代表任何观测到的智能体解决一个任务所需的最少Token数,与任务的人类时间跨度相对应,涵盖211个软件工程任务(METR,蓝色)和78个网络安全夺旗任务(AISI,红色)。数据来源于2025年4月至2026年4月发布的11个前沿模型(用于AISI的狭义网络任务CTFs),以及2023年3月至2025年12月发布的20个前沿模型(用于METR的任务)。
由于任务所需的预算随其长度增长,固定评估预算会首先在最长的任务上耗尽Token,而较短的任务仍能获得完整的尝试。因此,有上限的预算可能会低估模型能解决的任务时长:它截断的任务系统性地是最长的,因此失败可能意味着运行预算不足,而非智能体缺乏能力。例如,AISI的网络靶场“The Last Ones”估计需要人类专家大约20小时才能完成。我们测试的所有模型,只有在获得至少3000万Token的计算预算后才能完成它。
更高的预算揭示了更大的当前能力和更快的前沿进展。
我们发现,较新的模型将额外的测试时计算转化为比旧模型更大的收益(图5)。这意味着能力曲线不仅向上移动,而且改变了形状,尤其是在更困难的任务上。

Tweet This Image
Download Image
图5. 前沿模型的进步沿着三个轴重塑了任务的能力曲线:覆盖范围、可靠性和效率。使用控件进行实验,看看这些收益如何在一系列任务中复合。数据为示意。
这些收益体现在三个维度上。较新的模型能解决更困难的任务(覆盖范围),更一致地成功完成它们(可靠性),并且能用更少的Token解决某些任务(效率)。³
我们通常通过估计模型时间跨度翻倍的速度来追踪前沿进展:如果今天一个模型能完成8小时的任务,那么下一个模型需要多久才能管理16小时?但模型估计的时间跨度——以及随着新模型发布而翻倍的速度——取决于计算预算。

Tweet This Image
Download Image
图6A和6B. 每个模型的80%时间跨度是指模型有80%成功概率的人类任务完成时间,特指狭义网络任务。时间跨度通过对Token截断的成功率进行惩罚逻辑斯蒂拟合来估计。翻倍率仅基于前沿模型估计。
我们使用这个80%时间跨度来询问网络能力进展的速度。在之前的研究中,我们估计自2024年底以来,AISI网络CTF套件上的前沿模型时间跨度每4.7个月翻一番,这是以每个任务250万Token的固定预算测量的。我们指出,这个预算上限可能低估了模型在更大计算预算下所能达到的水平。
对于过去一年发布的模型,当时间跨度以每个任务5000万Token而非250万Token估计时,拟合的前沿趋势陡峭了约60%(图6B)⁴。换句话说,估计的翻倍率部分取决于评估中使用的计算预算,而非前沿网络进展的固定属性。
图6A在模型层面展示了相同的效应。新旧模型之间的差距也随着它们获得的算力增加而扩大:一个近期前沿模型的时间跨度从250万Token预算下的约40分钟上升到5000万Token预算下的约4小时(图6A)。在当前前沿,将预算从250万Token提高到5000万Token,估计的时间跨度从(大约)2小时增加到14小时(图6B)。
其他研究支持这些发现。在Epoch的MirrorCode上,模型被要求从头重建现有软件程序,一个近期模型使用了高达10亿Token来取得先前模型无法取得的进展,而这本需要人类工程师数周的工作。
讨论
没有用于估计智能体能力的计算预算,就无法解释其能力。 预算会改变测量到的性能,设定评估能达到的任务时间跨度,并塑造前沿进展看起来的速度。评估应报告能力曲线,尤其是当性能可能仍在上升时。
这对于关于部署、经济价值和风险的决策至关重要:在过小预算下测量的分数可能使模型看起来不如在现实使用中拥有更多算力时那么有能力。
了解能力在何处达到平台期至关重要。重要的是,随着每Token成本下降,更高的测试时预算变得越来越容易获得,曾经可能成本高昂的能力会随着时间的推移变得更便宜、更容易获得。
这一切都不需要对AI的发展方向做出戏剧性的断言。这是一个关于良好测量的问题:如果我们继续将能力视为一个固定分数而不是一条关于算力的曲线,我们将不断对这些系统在投入更多资源时能做什么感到惊讶。对于依赖这些结果的开发者、评估者和政策制定者来说,将测试时计算纳入能力的测量和报告方式,是区分一个能为决策提供信息的数字和一个悄悄误导决策的数字的关键。
我们的发现提出了三个开放性问题:
在哪些方面,更多算力能可靠地带来更多能力,为什么? 收益似乎在智能体可以检查工作并从错误中恢复的领域(如代码、网络和数学)最为强劲。在反馈缺失、延迟或嘈杂的领域,收益可能较弱。
能否从更经济的运行中估计高预算性能? 这很重要,因为最具信息量的评估可能成本高昂。
人类任务时间在多大程度上能预测模型所需的算力? 这种关系在网络和软件工程任务中出现,但可能因领域而异,并且可能随着模型变得更Token高效而改变。
展望未来
这些发现已经在塑造AISI的评估:
我们在多个预算下评估前沿模型,包括针对最困难任务的非常大预算。
我们报告相对于预算的可靠性和覆盖范围,以便能够区分真正低能力的模型和资源不足的评估。
我们正在努力定义“最小信息预算”,通过检查模型的覆盖范围是否已停止随更多算力而上升。
我们正在开发从更经济的运行中预测高预算性能的方法。
我们正在与国际合作伙伴分享这项工作,以支持针对能力日益增强的AI智能体的稳健评估和报告实践,领先的提供商现在也在这样做。
如需更深入了解我们评估的结果,请阅读完整的技术论文:关于跨基准测试的测试时缩放和分解测试时缩放曲线(即将发布)。