论文

论引文在偏好数据中的作用

On the Role of Citations in Preference Data

模型评测模型行为与机制分析

摘要

许多 NLP 任务要求系统在其输出中提供归因,即引用证据来源。归因是防止模型幻觉的堡垒,也是用户验证模型输出可信度的一种手段。然而,尚不清楚人类和 LLM 在比较输出时如何评估引用,这是奖励建模和现代 LLM 后训练 的核心过程。本文研究了引用在人类法官偏好中的作用以及科学问答背景下的四个开源 LLM,利用混合效应模型研究引用对成对判断的影响。我们的主要发现包括(1)人类更喜欢多样化的引用,但整体上较少,(2)尽管无法访问来源,但 LLM 与人类相比显示出一些与引用相关的偏好,但这些偏好取决于数据和特定模型。我们进一步讨论我们的研究结果对偏好数据收集的影响。