论文
ShopSimulator:评估与探索RL驱动的购物助手LLM智能体
ShopSimulator: Evaluating and Exploring RL-Driven LLM Agent for Shopping Assistants
摘要
基于大语言模型(LLM)的智能体越来越多地部署于电商购物。要进行彻底的、面向用户定制的商品搜索,智能体应理解个人偏好、进行多轮对话,并最终在高度相似的商品中检索和甄别。然而,现有研究尚未提供一个能一致涵盖所有这些方面的统一模拟环境,且往往只关注评估基准而缺乏训练支持。本文介绍ShopSimulator,一个大规模且具挑战性的中文购物环境。借助ShopSimulator,我们在多样场景中评估LLM,发现即使表现最好的模型完全成功率也不足40%。错误分析显示,智能体在长轨迹中的深度搜索和商品选择上表现吃力,无法平衡个性化线索的使用,也难以有效与用户互动。进一步的训练探索为克服这些弱点提供了实用指导,其中监督微调(SFT)与强化学习(RL)相结合带来显著性能提升。代码和数据将发布于 https://github.com/ShopAgent-Team/ShopSimulator。
