论文

客户代理:通过工具增强代理和 RLVR 克服超长购物轨迹中的上下文限制

Customer-Agent: Overcoming Context Limitations in Ultra-Long Shopping Trajectories via Tool-Augmented Agents and RLVR

智能体系统Agent 工具调用

摘要

了解客户的购物轨迹对于实现个性化购物体验至关重要。然而,购物记录(即客户的搜索、点击、购买等)通常跨越多年的较长时间范围,导致轨迹极长,这对现有的 大语言模型 (LLM) 构成重大挑战。尽管这个问题很重要,但现有的基准仅限于较短的客户轨迹,而由于数据隐私的限制,来自大型电子商务平台的真实世界轨迹很少可访问。为了解决这一差距,我们引入了 ShopTrajQA,这是一个根据真实世界的产品信息和模拟购物轨迹构建的长上下文评估基准。该数据集包括多达 32k 和 64k 标记的变体,可以在不同的上下文长度下系统地评估模型的鲁棒性。通过对前沿 LLM 的全面基准测试,我们确定了长购物轨迹数据推理中的关键性能差距。为了应对这些挑战,我们提出了一个用于超长上下文管理的客户代理框架。利用具有可验证奖励的强化学习(RLVR)代理训练范例,我们的方法将轨迹存储为外部本地文件,并训练代理通过代码解释器交互(例如 SQL 查询)自主检索和解析它们,有效地绕过 LLM 的固定上下文窗口约束。实验结果表明,我们的框架在 ShopTrajQA 中实现了强大的性能,并显示出对其他复杂推理任务的泛化能力。