论文

用户反馈提供了 LLM 无法检测到的独特信号

User Feedback Provides a Unique Signal that LLMs Can not Detect

模型评测模型行为与机制分析

摘要

利用用户交互中自然发生的反馈为 大语言模型 (LLM) 提供了一个有希望的学习信号。然而,最近的研究表明这种反馈本质上是嘈杂的并且难以有效利用。我们通过证明用户反馈是一个高度可行的改进信号来挑战这一概念,并且其感知的无效性源于当前评估范式中的系统偏差。为了隔离反馈的有用性,我们使用明确的 真值 构建合成数据,以及自然数据来验证我们的发现在现实场景中是否成立。通过比较两种设置中访问反馈和不访问反馈时生成的模型修订,我们发现反馈通知修订以明显高于基线修订的速度解决目标问题。最后,我们揭示了评估偏差的根源:当模型完全由于反馈而成功解决问题时,LLM 法官经常无法识别真正正确的响应,而是系统地倾向于较差的基线输出。