论文

通过有效反馈计算来缩放代理Harness定律

Scaling Laws for Agent Harnesses via Effective Feedback Compute

模型推理测试时计算扩展

摘要

代理通过控制工具使用、反馈、验证、记忆和修复来利用形状语言模型性能。然而,原始测试时间支出,例如词元、工具调用、挂起时间或成本,无法区分有用的反馈和冗余或不稳定的交互。我们引入了\emph{有效反馈计算}(EFC),这是一种用于信息丰富、有效、非冗余和保留反馈的跟踪级缩放坐标。我们进一步定义了估计 EFC、NRS-EFC、利用效率 $η$ 以及针对实际跟踪和异构任务的任务需求标准化。在综合、真实、保留和前瞻性评估中,基于 EFC 的坐标优于原始计算基线和 SAS。 Oracle-EFC/$D_{\mathrm{task}}$ 在受控缩放中达到 $R^2=0.99$,NRS-EFC/$D_{\mathrm{task}}$ 在原始计算接近零或负拟合的真实轨迹上达到 $R^2=0.93$。最后,我们使用 EFC 作为现有Harness的配套控制层,将平均通过率从 $61.2\%$ 提高到 $68.2\%$,同时在匹配设置下将平均原始成本从 $213.8$ 降低到 $85.1$。这些结果表明,Harness扩展取决于持久的、任务充足的反馈,而不仅仅是原始计算。