论文

共同进化代理推荐系统的自蒸馏强化学习

Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems

模型训练强化学习

摘要

大语言模型 授权的代理推荐系统 (ARS) 将推荐重新表述为推荐代理和用户代理之间的多轮交互,从而实现超越传统一次性预测的迭代偏好引发和细化。然而,现有的 ARS 主要在反射式范式中进行优化,其中过去的交互轨迹存储为文本记忆,并作为提示上下文检索以供以后推理。尽管这种设计允许智能体回忆之前的反馈和观察结果,但积累的经验仍然是模型参数的外部因素,使得智能体依赖于通用推理,而不是通过学习逐步获得针对特定推荐的决策能力。因此,强化学习(RL)提供了一种将此类交互体验内化为参数的自然方法。然而,现有的 ARS 强化学习方法仍然存在两个关键限制。首先,他们未能捕捉到ARS的交互本质,其中推荐代理和用户代理不断相互影响,并可以通过交互反馈自然地产生内生监督。其次,它们将丰富的多轮交互过程简化为最终结果,忽略了整个轨迹中嵌入的密集监督。为此,我们提出了 CoARS,一种用于共同进化代理推荐系统的自蒸馏强化学习框架。 CoARS 引入了两种互补的学习方案:交互奖励(从相同的交互轨迹中为推荐代理和用户代理导出耦合任务级监督)和自蒸馏贡献分配(在师生条件下将历史轨迹转换为 词元级贡献归因信号)。对多个数据集的实验表明,CoARS 在推荐性能和用户对齐方面优于代表性 ARS 基线。