论文
AdaRubric:LLM 代理评估的任务自适应量规
AdaRubric: Task-Adaptive Rubrics for LLM Agent Evaluation
摘要
LLM-as-Judge 评估失败了代理任务,因为固定的评分标准无法捕获对该任务重要的内容:代码调试需要正确性和错误处理;网络导航需要目标一致和行动效率。我们提出了 ADARUBRIC,它通过根据任务描述动态生成特定于任务的评估规则、通过置信加权的每维度反馈逐步对轨迹进行评分,以及使用新颖的 DimensionAwareFilter 过滤偏好对来缩小这一差距——这是防止高分维度掩盖维度级故障的可证明的必要条件。在 WebArena 和 ToolBench 上,ADARUBRIC 实现了 Pearson r=0.79 人类相关性(比最佳静态基线+0.16)和部署级可靠性(Krippendorff 的 $\alpha$=0.83)。在 ADARUBRIC 偏好对上训练的 DPO 代理在三个基准测试中比 Prometheus 获得了 +6.8 到 +8.5 pp 的任务成功率;获得转移到 SWE 基准代码修复(+4.9 pp),并在 5K 步时将 PPO 收敛加速 +6.6 pp - 两者都没有任何 rubric 工程。代码:https://github.com/alphadl/AdaRubrics。