论文
PADMÉ:用于 LM Agent评估器元评估的偏好对齐数据合成
PADMÉ: Preference Alignment Data Synthesis for Meta-Evaluation of LM Agent Evaluators
摘要
语言模型经常被用来评估其他语言模型。 LM 评估器跨多个标准对 Agentic 行为进行评分是有价值的,前提是其决策与人类判断一致。我们将评估这种对齐的问题称为元评估。直接解决这个问题很困难:收集人类数据的成本很高,绝对评分很难对齐,并且使用 LM 元评估器会重复出现可信度问题。我们采用元评估的重新表述作为偏好判断问题:我们不是比较人类和 LM 评估者的轨迹分数,而是询问他们隐含的偏好是否一致。在此基础上,我们引入了 PADMÉ,一种数据合成方法,可为 Agentic 设置生成可靠的基于标准的元评估数据。 PADMÉ 仅使用小型语言模型,在评估过程中不需要人工参与,并且在较低的计算预算下运行。我们构建了 PADMÉ 原型,并综合了涵盖四个 Agentic 域和三个评估标准的 1,000 个样本的数据集。对 150 个样本子集的人类验证表明,PADMÉ 将人类判断的一致性从原始基线的 73% 提高到 85%。使用我们的数据集对 25 个常见模型进行元评估,证明了评估性能与评分粒度、宽大程度和模型大小等因素之间的相关性。