论文

重播差距:LLM 中模型切换的静态评估代理得分错误的世界

The Replay Gap: Static Evaluation of Model Switching in LLM Agents Scores the Wrong World

智能体系统Agent任务评测

摘要

LLM 路由器通过将每个请求匹配到最便宜的适当模型来保证效率,并且越来越多地应用于多步代理中的每一步。然而,代理路由器的评估方式与单匝路由器类似:通过重播记录的轨迹并替换另一个模型记录的输出,假设轨迹的其余部分不受影响。我们通过分支执行轨迹来测试这个假设:我们在受控点分叉实时 SWE 基准代理轨迹,重建环境,使用不同的模型继续每个分叉,并与隔离采样和重放噪声的相同模型控制分叉进行比较。在六对配对运行(约 900 条执行轨迹)中,交换超出其匹配的控制底线 +0.25 至 +0.66 标准化编辑距离(多重校正 CI 排除零),重写了 61-94% 的分叉后操作; 74-77% 的早期交换在分叉后的第一次操作中出现分歧,而控制中的这一比例为 6-35%,只有 3% 的重放状态有效。两个方向上的发散度随着叉深度的增加而减小。我们观察到的所有五个结果翻转都发生在交换臂、升级拯救未解决的实例以及降级失去唯一的解决中,并且在 359 个控制分叉中发生零。使用日志拼接重播评估器对这些相同的交换进行评分,重播会错误预测每个与成功相关的结果调用,并预测与现实相似度为 0.00-0.11 的补丁。审核本底噪声,温度 0“决定论”取决于配置:超过 90% 的前叉上由 FP8 提供的控制有所不同,而由 AWQ 提供的控制则几乎相同;在预算紧张的情况下,更强大的模型通常会耗尽其步骤而不提交。基于重放的基准测试对代理路由的评分是错误的;我们释放我们的Harness和所有轨迹。