论文

忠实模拟人类购物行为

Towards Faithful Simulation of Human Shopping Behavior

模型训练强化学习

摘要

模拟真实的用户购物行为是电子商务场景中离线评估和强化学习的基础。虽然最近基于 LLM 和 VLM 的模拟器取得了令人鼓舞的进展,但由于两个原因,再现真实的浏览会话仍然很困难。 (i) 内存挑战:购物会话跨越数十页,但现有代理要么丢弃长期观察历史,丢失不断变化的用户状态,要么天真地将它们连接起来,压倒上下文窗口,甚至降低模拟质量。 (ii) 优化挑战:当前的用户模拟器通常受到监督,通过模仿或步骤级奖励来匹配每个记录的操作;由此产生的会话通常会表现出不切实际的模式,例如过度探索或过度被动,每步监督既无法检测也无法纠正。为了解决上述挑战,我们推出了 RecVerse,这是一个基于 GUI 的模拟代理,可以通过屏幕截图感知页面并生成忠实的多转弯轨迹。对于记忆挑战,RecVerse 采用了受认知启发的分层记忆:用于短期焦点的工作记忆、用于会话中跟踪的情景记忆以及用于高级意图的偏好记忆,并将记忆更新视为动作,以便智能体自适应地学习何时记忆以及记忆内容。对于优化挑战,RecVerse 使用轨迹级 RL 目标进行了优化,该目标对整个会话进行评分,从而使宏观层面的动作类型分布和微观层面的购物意图与真实用户保持一致。我们进一步发布了USB(用户模拟基准),这是一个用于多回合用户模拟的交互式电子商务GUI轨迹数据集。实验表明,RecVerse 在行为保真度和意图一致性方面都显着优于现有基线。