论文

Counsel:智能体任务的元评估数据集

Counsel: A Meta-Evaluation Dataset for Agentic Tasks

模型评测基准与评测资源

摘要

随智能体系统应对日益复杂的多步任务——评估其轨迹成为主要瓶颈——在流行智能体基准上人工标注单条轨迹可能耗时数小时——使为度量性能或策展训练数据而扩展评估变得困难。这推动广泛依赖LLM即裁判(LLMJ)等自动化方法——在规模上批评智能体的过程与结果——但LLMJ批评的健全性常未被度量。此处——我们介绍Counsel——首个面向智能体任务的公开元评估数据集。Counsel含来自开放权重LLMJ在两个智能体基准(tau-bench客服智能体与DA-Code编码智能体)上的过程级批评——以及人类对这些批评的元评估。人类标注者把每条被标记错误的批评标注为“完全正确”、“位置正确但推理糟糕”或“不该标记”——取得可靠标注者间一致性(Krippendorff's alpha 0.78)。所得数据集按轨迹内错误位置与推理质量的人类对齐分层LLMJ批评——作为校准、改进或训练面向智能体的LLMJ的宝贵数据。比较开放权重裁判——我们发现更有能力的裁判模型与更多推理投入都带来改进的人类一致性——最强裁判在位置上达约88%一致、推理上约65%。Counsel以开放权重模型生成——并以宽松许可证供社区广泛使用——我们希望这能促成对面向智能体系统的LLM评估者的严谨研究与改进对齐。