论文

超越离线 A/B 测试:用于推荐系统评估的上下文感知代理模拟

Beyond Offline A/B Testing: Context-Aware Agent Simulation for Recommender System Evaluation

智能体系统Agent 架构与控制循环

摘要

推荐系统是在线服务的核心,使用户能够浏览各个领域的大量内容。然而,由于离线指标和在线性能之间的脱节,他们的评估仍然具有挑战性。 大语言模型 驱动的代理的出现提供了一个有前途的解决方案,但现有的研究对用户进行孤立建模,忽略了时间、位置和需求等上下文因素,而这些因素从根本上影响了人类的决策。在本文中,我们介绍了 ContextSim,一个 LLM 代理框架,它通过锚定日常生活活动中的交互来模拟可信的用户代理。即,生活模拟模块生成指定用户何时、何地以及为何参与推荐的场景。为了使偏好与真实的人类保持一致,我们对代理的内部思想进行建模,并在行动和轨迹层面上强制执行一致性。跨领域的实验表明,我们的方法产生的交互比之前的工作更符合人类行为。我们通过离线 A/B 测试相关性进一步验证了我们的方法,并表明使用 ContextSim 优化的 RS 参数可以提高现实世界的参与度。