论文

Mid-Harness:在终端Agent的模型和Harness之间缩放操作

Mid-Harness: Scaling Actions Between Model and Harness for Terminal Agents

智能体系统Agent 动作执行与治理

摘要

终端Agent通过随机模型生成来行动,但生成有用操作的能力并不能确保其可靠执行。一个糟糕的命令(例如,错误的软件包安装)可能会以阻碍后续进展的方式改变环境,即使模型可以生成更好的替代方案。我们研究在模型Harness边界分配测试时计算是否可以提高动作可靠性和轨迹成功率,以及是什么使这种分配有效。为了研究这些问题,我们引入了 Mid-Harness,它在转发执行操作之前对候选操作进行采样和验证,同时保持生成器和Harness不变。使用 TMAX-9B 生成器,更多的动作采样在弱验证下几乎没有什么好处,而有能力的验证者可以利用同一生成器的有用替代方案。在 TerminalBench-Lite 上,GPT-5.6 Sol 验证器通过 8 个采样操作将基本Agent的 Pass@1 从 50.00% 提高到 68.03%。当相同的TMAX-9B模型作为验证器时,成对验证在评估的验证机制中表现最好。将更强的验证器的响应提取到 TMAX-9B 中进一步改进了 Pass@1,同时保持动作生成器不变。通过 TerminalBench-Lite 上的 TMAX-9B,与单独生成更多轨迹相比,结合动作和轨迹缩放可以以更低的估计词元成本获得更高的成功。 Mid-Harness 还提高了其他模型、基准测试和Harness的性能。这些发现将动作扩展确定为终端Agent中测试时计算扩展的一个有希望的目标。