论文
RecRM-Bench:代理推荐系统的多维奖励建模基准测试
RecRM-Bench: Benchmarking Multidimensional Reward Modeling for Agentic Recommender Systems
摘要
大语言模型 (LLM) 代理的集成正在将推荐系统从简单的查询项目匹配转变为深度个性化和交互式推荐。强化学习(RL)为推荐任务中这些代理的优化提供了一个重要的框架。然而,当前的方法仍然受到对单维基于结果的奖励的限制,这些奖励仅关注最终用户交互,而忽略了关键的中间功能,例如指令遵循和复杂的意图理解。尽管有必要设计多维度的奖励,但该领域缺乏一个标准化的基准来促进这种发展。为了弥补这一差距,我们引入了 RecRM-Bench,这是迄今为止最大、最全面的代理推荐系统基准。它包含跨越四个核心评估维度的超过 100 万个结构化条目:指令遵循、事实一致性、查询项相关性和细粒度用户行为预测。通过支持从句法合规性到复杂意图基础和偏好建模的全面评估,RecRM-Bench 为训练复杂的奖励模型提供了基础数据集。此外,我们提出了一个用于构建多维奖励模型和集成混合奖励函数的系统框架,为开发可靠且高性能的代理推荐系统奠定了坚实的基础。完整的 RecRM-Bench 数据集可在 https://huggingface.co/datasets/wwzeng/RecRM-Bench 上公开获取。