论文

StateM:通过Harness扩展在Terminal-Bench 2.1上达到95.3%原始准确率,或仅15美元的前沿模型运行成本

StateM: Reaching 95.3% Raw Accuracy, or a \$15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling

智能体系统上下文与知识记忆Agent HarnessAgent记忆Agent Runtime

摘要

长程智能体即使其底层模型能解决各个组成步骤,仍可能失败:它们可能丢失对可变状态的追踪、未能重新激活早期执行的经验、跳过已知流程或过早停止。我们押注于harness扩展(harness scaling),在不改变模型权重的情况下改进智能体周围的执行系统。我们引入StateM,一个Agent原生运行时,围绕持久状态、阶段局部上下文、带检查的状态转换、可恢复的runbook,以及智能体与用户可共同检查的版本化流程实践来组织执行。在Terminal-Bench 2.1上,StateM将GPT-5.5 xhigh提升至92.1%,参考为83.1%,GPT-5.6 Sol Ultra为91.9%。该runbook无需修改即可迁移到GPT-5.6。使用GPT-5.6 Sol xhigh时,StateM在445次试验中达到95.3%原始准确率,并在至少一次运行中完成全部89个任务。冻结配置把GPT-5.6 Luna从76.7%提升到85.4%,高于84.9%的Sol xhigh参考。使用相同的运行时、runbook结构和核心规则,不到38美元的适配使DeepSeek-V4 Flash在标准超时下从82.7%提升到88.1%,在88任务公共核心上达到89.1%;仅对剩余的延迟敏感任务做扩展,即可匹配所报告的GPT-5.6 Sol 88.8%的最高成绩。最终评分的API用量约为15美元,而GPT参考为574.68美元;DeepSeek总支出为52.22美元。在BusinessBench上,基于开发集构建的模型族专属runbook在留出集上带来0.55 macro和1.34 micro点的提升;两个机制匹配的模型族提升10.04点。当任务共享执行结构时,具体规则可泛化,而控制方法论适用面更广。StateM把选定的复盘发现转化为持久、可执行的前置条件和实践,使学到的控制通过有状态控制变得明确且可强制执行。代码见 github.com/henryqin1997/statem。