论文

ProductResearch:通过多智能体合成轨迹蒸馏训练电商Deep Research智能体

ProductResearch: Training E-Commerce Deep Research Agents via Multi-Agent Synthetic Trajectory Distillation

模型训练合成数据

摘要

基于大语言模型(LLM)的智能体在电商对话式购物中展现出前景,但现有实现缺乏复杂产品研究所需的交互深度与上下文广度。与此同时,Deep Research范式虽然在网络搜索的信息综合方面取得进展,但迁移到电商时存在领域差距。我们提出ProductResearch,一个多智能体框架,用于合成高保真、长时程的工具使用轨迹,以训练稳健的电商购物智能体。该框架采用User Agent从行为历史中推断细微的购物意图,并由Supervisor Agent编排其与Research Agent的迭代协作,生成以全面、富有洞察的产品研究报告收尾的合成轨迹。这些轨迹经过严格过滤与蒸馏,通过一个反思性内化过程把多智能体监督交互整合为连贯的单角色训练样本,从而能够有效微调LLM智能体以应对复杂购物询问。大量实验表明,在合成数据上微调的小型MoE模型在回答全面性、研究深度和用户感知效用方面相比基座模型取得大幅提升,接近前沿专有Deep Research系统的性能,并确立多智能体合成轨迹训练作为增强基于LLM的购物辅助的有效且可扩展范式。

ProductResearch:通过多智能体合成轨迹蒸馏训练电商Deep Research智能体
图1:ProductResearch 框架概览。User Agent 从行为历史中推断用户画像(persona)、研究查询与 RACE 评估量规。Research Agent 在 Supervisor Agent 的步骤级监督下执行 Plan→Toolcall→Report 推理,Supervisor Agent 提供针对状态的验证与纠正性反馈。获批的轨迹按长度过滤,并通过反思性内化蒸馏为单角色序列,用于监督微调。