论文

ShopSimulator:评估与探索RL驱动的购物助手LLM智能体

ShopSimulator: Evaluating and Exploring RL-Driven LLM Agent for Shopping Assistants

智能体系统模型训练强化学习Agent任务评测Agentic RL

摘要

基于大语言模型(LLM)的智能体越来越多地部署于电商购物。要进行彻底的、面向用户定制的商品搜索,智能体应理解个人偏好、进行多轮对话,并最终在高度相似的商品中检索和甄别。然而,现有研究尚未提供一个能一致涵盖所有这些方面的统一模拟环境,且往往只关注评估基准而缺乏训练支持。本文介绍ShopSimulator,一个大规模且具挑战性的中文购物环境。借助ShopSimulator,我们在多样场景中评估LLM,发现即使表现最好的模型完全成功率也不足40%。错误分析显示,智能体在长轨迹中的深度搜索和商品选择上表现吃力,无法平衡个性化线索的使用,也难以有效与用户互动。进一步的训练探索为克服这些弱点提供了实用指导,其中监督微调(SFT)与强化学习(RL)相结合带来显著性能提升。代码和数据将发布于 https://github.com/ShopAgent-Team/ShopSimulator。

ShopSimulator:评估与探索RL驱动的购物助手LLM智能体
图1:ShopSimulator 示意。一方面,助手智能体需要从用户画像中解读偏好,并与用户沟通以了解其购物需求;另一方面,智能体迭代地检索数据库,点击并查看商品,最终推荐合适的物品。