论文

轨迹法官:仅结果 LLM 法官在智能体轨迹上错过了什么

trajectory-judge: What Outcome-Only LLM Judges Miss on Agent Trajectories

智能体系统Agent任务评测

摘要

仅结果评估是 LLM 代理的生产默认设置:向法官展示请求和最终答复,并询问是否处理得好。该指标在结构上对以错误方式得出正确答案的智能体是盲目的。我们通过构建来测量 真值 已知的盲点:使用确定性工具的支持台环境,始终解决该问题的脚本化预言机策略,以及在已知步骤中精确破坏一件事的故障注入器,根据客户可见的结果是否幸存(无声)或失败(大声)对故障进行分层。五名评委(程序规则、仅结果、两种模型大小的步骤规则以及自洽整体)对检测、步骤定位、错误分类、校准和超过 400 条轨迹的成本进行评分。只看结果的法官能发现 84% 的大错误,45% 的无声错误,同时标记出 33% 的正确轨迹;阶梯式法官以 3 倍的成本达到 77% 的无声召回率和零误报。没有法官会阅读最终的答复:附加到原本完美的轨迹上的虚构承诺完全规避了规则,并且在 82% 的情况下进行步骤判断,自我一致性使成本增加了三倍,却没有任何改进。我们认为,法官评估必须根据结果生存对召回进行分层,并释放环境、注入器、所有原始判决以及离线重建每个数字的分析管道。