论文
使用二元反馈个性化 LLM:偏好校正优化框架
Personalizing LLMs with Binary Feedback: A Preference-Corrected Optimization Framework
摘要
大语言模型 (LLM) 个性化旨在使模型行为与个人用户偏好保持一致。现有的方法通常关注孤立的用户历史,忽略了用户间差异的重要作用。我们提出了 C-BPO,这是一个通过偏好校准的二进制信号个性化 LLM 的框架。通过将目标用户数据视为正反馈,将其他用户的数据视为隐含负信号的辅助集,C-BPO 捕获了不同的用户间差异。为了缓解偏好重叠问题(共享任务知识被错误地惩罚),我们得出了一个基于正向无标签(PU)学习理论的目标。这种方法通过减去“积极偏见”来净化消极信号,确保与独特的特质保持一致,而不影响一般的帮助。跨各种个性化任务和主干 LLM 的实证实验表明,C-BPO 始终优于基线,证明了偏好校准的二进制信号在建模用户间差异方面的有效性。