论文
RecoReward:推荐者引导的多模态描述生成以进行推荐
RecoReward: Recommender-Guided Multimodal Description Generation for Recommendation
摘要
多模态 大语言模型 (MLLM) 可以将多模态项目内容转换为结构化描述,用作推荐的语义特征。然而,传统的仅内容生成不能使用下游用户信号来确定应该强调哪些语义。最近的用户条件方法通过用户历史或配置文件合并这些信号,但它们在推理时需要用户信息,并使生成依赖于用户。在本文中,我们介绍了 RecoReward,它在训练期间使用行为衍生奖励并保留仅内容推理。为了在直播推荐中实例化这一想法,我们将历史参与的用户视为未来目标用户的代理,并使用观察性非目标用户来估计用户之间广泛共享的亲和力。推荐亲和力分数 (RAS) 对比这些信号,为强化学习提供用户选择性反馈,从而允许学习策略生成单个共享描述,而无需用户输入。在我们的离线基准测试中,RecoReward-9B 在七个召回指标上的表现优于其 Qwen3.5-9B 基线和所有其他评估模型。在线 A/B 测试也显示出性能提升。这些结果表明,RecoReward 训练 MLLM 生成有利于下游推荐的项目特征,同时保留仅内容服务。