论文
您的鼠标和眼睛秘密泄露您的偏好:使用用户隐式反馈进行 LLM 对齐
Your Mouse and Eyes Secretly Leak Your Preference: LLM Alignment using Implicit Feedback from Users
摘要
为了对齐 大语言模型 (LLM),大多数现有方法都会收集明确的人类反馈并训练奖励模型以根据响应文本预测人类偏好。这些现有方法有两个主要局限性。首先,用户很少为 LLM 响应提供明确的反馈,这使得高质量的偏好注释的收集成本很高。其次,这些方法没有利用隐性的人类反馈,而事实证明,这对于互联网巨头的经济护城河至关重要。为了量化隐式反馈的价值,我们构建了一个名为 IFLLM 的新数据集,该数据集收集了 59 名 Mechanical Turk 工人的 1336 个多轮问题、他们的鼠标轨迹以及 LLM 从网络摄像头中做出的反应的注视点。 IFLLM 显示用户具有非常多样化的注视行为和鼠标轨迹类型。我们基于隐式用户反馈的奖励模型将基于文本的奖励模型的准确性从 55% 提高到 64%,并将 DPO 应用于 8 个 LLM 后,相对响应质量提高了近三倍,证明了隐式反馈的实际价值。我们的数据收集网站、数据集和代码可以在 https://github.com/themehulpatwari/LLM-implicit-feedback/ 找到。