论文
LLM 判断与人类判断分布的事后对齐
Post-hoc Alignment of LLM-judges to Human Judgment Distribution
摘要
LLM-as-a-judge (LLMaJ) 框架为自动评估提供了一种经济高效且可重复的解决方案。然而,当前的评估实践通常将 LLMaJ 判断与聚合的 真值 标签进行比较,忽略了人类标签变异 (HLV) 中包含的有价值的信息。受到越来越多建议利用 HLV 的工作的启发,我们系统地研究了 LLMaJ 在预测代表人类判断分布 (HJD) 的单个聚合 真值 硬标签和未聚合软标签方面的性能。我们在五个不同数据集上的结果表明,虽然 LLM 在大多数任务的硬标签预测中实现了接近人类水平的性能,但它们在预测软标签时表现不佳。为了解决这个限制,我们提出了 NAPHA(eNtropy-Aware Post-Hoc Alignment),这是一种简单而有效的轻量级事后对齐方法,通过首先将实例分配给离散熵类,然后将其路由到专门的、训练有素的对齐模型,将 LLM 分布与 HJD 进行匹配。我们发现 NAPHA 持续改进了基本 LLM 模型和数据集的软标签预测,在捕获不同人类观点最为关键的高熵实例上取得了特别显着的收益。我们还通过预言机实验表明,改进熵类别预测可以大大提高 NAPHA 的实际有效性。