StateM:通过Harness Scaling在Terminal-Bench 2.1上达到95.3%原始准确率,或15美元前沿运行
StateM: Reaching 95.3% Raw Accuracy, or a \$15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling
长程智能体即使其底层模型能够解决各个组成步骤,也可能失败。它们可能丢失可变状态的追踪、未能重新激活早期执行中的经验教训、跳过已知流程,或过早停止。我们押注于“框架扩展”(harness scaling),即在不改变模型权重的情况下改进智能体周围的执行系统。我们引入了StateM,一个智能体原生运行时,它围绕持久状态、阶段局部上下文、受检转换、可恢复运行手册以及智能体和用户可共同检查的版本化程序实践来组织执行。
在Terminal-Bench 2.1上,StateM将GPT-5.5 xhigh提升至92.1%,而参考结果为83.1%,GPT-5.6 Sol Ultra为91.9%。该运行手册无需修改即可迁移至GPT-5.6。使用GPT-5.6 Sol xhigh时,StateM在445次试验中达到95.3%的原始准确率,并在所有89项任务上至少成功一次。冻结的配置文件将GPT-5.6 Luna从76.7%提升至85.4%,高于84.9%的Sol xhigh参考结果。
使用相同的运行时、运行手册结构和黄金规则,不到38行适配代码将DeepSeek-V4 Flash在标准超时下从82.7%提升至88.1%,在88项公共核心任务上达到89.1%。仅扩展剩余延迟敏感任务即可匹配所报告的88.8% GPT-5.6 Sol最高结果。最终评分的API使用量约为15美元,而GPT参考为574.68美元;DeepSeek总支出为52.22美元。
在BusinessBench上,基于开发集构建的特定家族运行手册在保留集上带来0.55个宏平均和1.34个微平均点的提升;两个机制匹配的家族提升了10.04个点。当任务共享执行结构时,具体规则能够泛化,而控制方法则广泛适用。StateM将选定的事后分析发现转化为持久、可执行的先决条件和实践,通过有状态控制使学习到的控制显式且可强制执行。代码见github.com/henryqin1997/statem。