论文

DIAL:去位置偏差并向有限人工偏好校准

DIAL: Position-Debiased LLM Judges with Adaptive Human Preference Calibration

模型评测评测方法与指标

摘要

作为法官的大型语言模型(LLM)可以进行可扩展的评估,但它们的判断可能对响应顺序敏感,即使在消除这种位置影响后,仍然可能系统地偏离人类偏好。我们引入了 DIAL,一个统一的框架,它将丰富的 LLM 比较与有限的人类比较相结合,以分离法官特定的位置效应,学习去除位置偏差后的LLM偏好中的共享结构,并根据人类偏好目标自适应地校准该结构。理论上,我们研究了 DIAL 的三个方面:(i) 识别潜在的 LLM 偏好、位置效应和人类校准; (ii) 自适应估计,平衡大语言模型锚定与有限的人类证据; (iii) 校准人类偏好的固定权重不确定性量化。根据经验,我们在受控模拟和三个人类偏好基准上分别评估了位置去偏差和人类对齐,结果表明 DIAL 对不平衡的响应顺序保持稳健,在有限的标签下实现了强大的人类对齐排名,并在 LLM 信息不完善时适应人类证据。我们的真实数据研究收集了 21 个大语言模型法官的超过 41 万条判断,这为未来研究大语言模型法官偏见、异质性和人类一致性提供了资源。

DIAL联合建模LLM与人工比较,分离位置偏差并校准人类偏好。
图1(图注摘要):DIAL联合建模LLM与人工比较,分离位置偏差并校准人类偏好。