论文
EarlyEval:通过早期结果预测进行更便宜的代理评估
EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction
摘要
评估 LLM 代理对于指导其开发至关重要,但它的成本却变得过高:前沿模型对代理基准的单次传递可能会花费数百至数千美元,这是在迭代开发周期中反复付出的代价。之前以基准 蒸馏 为中心的努力减少了评估任务的数量,但执行每个保留任务的成本保持不变。在这项工作中,我们引入了早期结果预测,这是一个补充效率轴,可以降低每项任务的成本。我们的主要见解是,代理的最终结果通常可以从执行完成之前的中间行为中看出。我们在 EarlyEval 中实例化了这个想法,这是一个轻量级框架,可以根据行为、文本和参考解决方案特征训练一对 LightGBM 成功和失败分类器,并在任一分类器跨越校准置信度阈值时停止代理运行,从而增加可忽略不计的每步开销。在 SWE-bench Verified、TerminalBench 和 Toolathlon 三个基准测试中,EarlyEval 可以消除 13%-26% 的代理步骤以及高达 44.1% 的输入词元和 29.4% 的输出词元,预测精度为 89%-97%,同时平均每个代理的解析率仅干扰一到两个百分点。