论文
策略即代码:面向CAR-bench快速推理可靠性的协程桥接Harness
Policy as Code: A Coroutine-Bridge Harness for Fast-Reasoning Reliability on CAR-bench
摘要
CAR-bench评测工具使用型智能体在真实世界不确定性下能否保持可靠,每个工具都在评测器内部执行,使每次工具结果交换都是智能体的一次独立往返。传统下一动作型智能体可以批量发起并行工具调用,但一条依赖调用链在每轮结果上都要花费一次模型调用。我们提出一种协程桥接harness:模型唯一的动作是发出一个Python程序,该程序在评测器的工具交换过程中原地阻塞并恢复。这将模型调用与工具往返解耦:在公开测试集上,智能体每任务中位数仅用两次模型调用对抗七个智能体轮次,在Cerebras gpt-oss-120b上以中位数1.8秒的模型时延解决完整的多轮任务。由于动作面是可执行代码,确定性的CAR-bench策略被直接编码为工具层的逻辑而非提示规则,以零推理成本强制合规。在官方隐藏评测中,该harness以60.0%的Pass^3赢得赛道2,是组织者基线的4.5倍,且在得分超过基线的参赛者中估计成本最低、中位任务时延最快(3.14秒);同一未经改动的harness在公开赛道的GPT-5.5上复现了完全相同的60.0% Pass^3,比肩前沿模型智能体。单个静态提示在尾部附加每任务状态,在调用之间和任务之间保持字节级一致:冻结的提交提示从缓存服务了78%的输入token(热尾部分为86.6%),而三周开发语料中提示编辑反复重置缓存、仅为73%。这将少量调用设计进一步复合为名义输入计算的一小部分。