论文

LLM Agent 轨迹早期结果预测的测试驱动可靠性审计:目标特定校准迁移误差在单一基准内持续存在

Testing-Driven Reliability Audit of Trajectory-Based Early Outcome Prediction for LLM Agents: Target-Specific Calibration Transfer Persists Within a Single Benchmark

智能体系统Agent任务评测

摘要

基于轨迹预测早期结果可以降低 Agent 评测开销:一旦结果变得足够可预测就终止运行——前提是预测器的置信度经过良好校准。当预测器被应用于一个从未在其上训练的 Agent 时,校准面临风险,但尚不清楚此类迁移失败是广泛存在于各 Agent 系统之间,还是集中在特定的目标 Agent/预测头组合上。使用公开的 SWE-bench Verified 轨迹和一个冻结的双头早期结果预测流水线,我们运行了留一 Agent 校准审计、共享预测器留二 Agent 对照、先知先验校正,以及覆盖训练队列、任务重采样、任务对半、折刀法与阈值的鲁棒性测试。固定脚手架的 TerminalBench 分析作为预注册的边界测试。广泛的同预测器成对异质性未获支持:成对校正差距的中位数分别为 0.0180(SUCCESS 头,45 对)与 0.0385(FAILURE 头,35 对),预注册的异质性判据在两个头上都未达到。两个特定组合——gpt-5-mini/SUCCESS 与 claude-opus-4.6/FAILURE——表现出持续的校准迁移误差(中位校正差距 0.1377 与 0.1107),且在任何冻结对照下都没有符号反转。TerminalBench 未确立跨基准复现:成功目标产生零决策(不确定),失败目标不满足预注册的持续性判据。因此,强目标特定的校准迁移误差可以存在于单一冻结环境内,但证据并不支持该误差是模型内在的或跨基准普遍的。