论文
不同反馈、不同更新:大语言模型面向用户交互的选择性自学习
Different Feedback, Different Updates: Selective Self-Learning from User Interactions for Large Language Models
摘要
用户反馈为LLM的持续改进提供了天然的监督信号,但一条消息可能支持多种泛化范围不同的行为改变。我们提出SLIFT,一个建立在用户反馈的任务相对视角之上的选择性自学习框架。SLIFT把每条反馈消息分解为原子组件,并相对原始任务将各组件解读为Fix、Spec或Null:分别是任务有效性的要求、兼容的条件性细化,以及没有可靠正向更新方向的内容。为在合适的范围内纳入每种改变,SLIFT在共享冻结骨干上训练两个互补的LoRA适配器:Generalist通过反馈条件化自蒸馏把Fix需求固化为默认行为;Specialist仅观察任务与Generalist的回复,为适用而尚未满足的Spec细化提供残余指导。Null组件不引发任何正向更新。跨多个骨干,SLIFT在MemoryBench与WildFB上均取得强劲表现,针对性分析进一步考察了其内在机制。代码发布于 https://anonymous.4open.science/r/SLIFT。
