论文

将安全作为约束:微调推荐大模型以解释自身推荐

Safety as a Constraint: Fine-Tuning a LLM Recommender to Explain Itself

模型训练强化学习

摘要

传统推荐系统通常仅预测用户下一次会互动的物品,而不解释原因。提供个性化证据以说明用户可能喜欢推荐物品是提升服务质量和提升用户真实兴趣的重要方式。该服务可通过在面向用户的流程中集成前沿模型调用实现,但会增加额外成本和延迟。本文训练一个推荐LLM,基于一家大型视频流媒体服务的用户观看历史生成个性化解释,要求生成的解释必须忠实于所关联节目的内容元素,且必须严格无害于用户。为此,我们首先训练两个LLM判别奖励模型,覆盖三个具体标准,并提出约束性GRPO方法融合这些不同标准。在独立的现实世界测试集上,我们的微调模型同时满足三个标准的PASS率分别从0.649提升至0.956(由自身评估)和从0.677提升至0.931(由独立评估),而前沿生成器的表现与未微调的推荐基线相当。进一步实验表明,模型的语言和推荐能力保持不变。因此,我们得出结论:基于LLM的推荐系统可以在不损害原有推荐性能的前提下,被微调用于其他复杂任务,为未来由单个模型驱动的智能体用户界面提供参考。

将安全作为约束:微调推荐大模型以解释自身推荐:论文配图
图 1:上图:我们的端到端微调流程:我们通过引用用户之前观看过的类似节目来解释推荐。我们对两名基于LLM的法官进行微调,以评估三个标准生成的解释,并应用原始-对偶优化来增加忠诚度奖励,同时保持在无害性约束范围内。下:经过微调的LLM可以恰当地描述 LGBTQ 戏剧的各个方面,而不会造成刻板印象或冒犯。