论文

人类标签变化作为稳定信号:通过跨注释者偏好优化学习注释者特定的解释行为

Human Label Variation as Stable Signal: Learning Annotator-Specific Explanation Behavior via Cross-Annotator Preference Optimization

模型训练偏好优化

摘要

自由文本解释通过揭示注释者决策背后的推理和偏好,将人类标签变异 (HLV) 扩展到标签分歧之外。我们研究 大语言模型 (LLM) 是否可以学习和重现这种特定于注释器的标签解释行为。使用两个句子对任务,每个任务有四个注释器——自然语言推理和释义判断——我们首先分析注释器是否表现出稳定的个体模式。我们发现,由于输入内容效应较强,此类模式在单注释级别上较弱,但在输入内容缩减和注释器级别聚合后变得可检测。然后,我们比较提示和监督 微调 (SFT) 基线,并提出跨注释者偏好优化 (CAPO),它将目标注释者的响应与同一输入的其他有效但不太特定于目标的注释进行对比。实验表明,提示是有限且不稳定的,SFT 可以更好地捕获注释者特定的行为,CAPO 进一步改进聚合感知的模仿和基于判断的归因,同时在人类验证下保留目标特定的推理模式。总的来说,我们的结果表明,HLV 可以作为特定于注释者的标签解释行为来学习,这表明了一条基于注释者历史而不是单独标签的可扩展的基于解释的注释的路径。