论文

让购物智能体从在线用户反馈中学习

Learning from Online User Feedback for Shopping Agents

模型训练强化学习Agentic RL

摘要

基于大语言模型的购物智能体正日益部署于真实电商平台,产生海量用户交互日志,为改进这些智能体提供了有价值的监督。然而,现有方法主要依赖离线训练信号,如用户-物品交互或合成偏好数据,而在很大程度上忽视了用户自然对话反馈中蕴含的丰富监督。此外,可用的在线反馈是异构、稀疏且带噪的,难以自动转化为可靠的学习信号。为应对这些挑战,我们提出LOFA,一个使购物智能体直接从真实在线交互日志中学习而无需人工标注的框架。LOFA将基于可验证购买结果的强化学习与反馈感知的在线策略蒸馏相结合,后者识别用户对话中的指令并将其转化为密集的token级监督。这些互补目标同时捕捉协作行为模式与用户特定偏好。在真实电商日志上的大量实验表明,LOFA在推荐质量、回复有用性和用户满意度对齐上持续优于强基线,凸显了从真实在线用户反馈中学习购物智能体的有效性。

让购物智能体从在线用户反馈中学习:论文配图
图2:我们 LOFA 框架的整体架构。