论文

MIMESIS:通过用户模拟器训练交互式Agent

MIMESIS: Learning User Simulators as Training Environments for Interactive Agents

模型训练模型优化智能体系统监督微调与指令调优强化学习Agent 环境交互蒸馏Agentic RL

摘要

训练和评测交互式语言Agent通常需要丰富的用户交互,但采集人工反馈成本高且难以扩展。模拟用户提供了可规模化的替代方式,前提是既接近真实用户行为,又能为Agent提供有用的学习经历。大多数现有Agent训练框架直接采用通用助手LLM,其乐于配合的倾向使模拟用户比真实用户更合作、表达更明确、行为更同质。我们提出MIMESIS,这是一个专门训练的用户模拟器,利用真实对话、显式推理监督及从真实交互归纳出的13种行为模式训练。9B模型的SOUL-Index达到65.7,超过受测的最强前沿模型。相较于RealUserSim和SimulatorArena上的最强基线Claude-Opus-5,MIMESIS分别将行为保真度提高13.4点、图灵距离降低3.6点。随后,我们冻结模拟器,让Agent通过与其交互开展多轮强化学习。在八个环境和全部九种未见用户模拟器上,使用MIMESIS训练的Agent均优于使用GPT-5.5训练的Agent,表明其能更好地泛化到新的用户模拟器。我们还提出教练式在策略自蒸馏(CSD),将模拟器生成的内部推理轨迹和后续表达用作Agent满足用户需求程度的反馈。教练模型将其转为简洁的指导笔记,说明Agent如何预判用户需求并在交互中调整行为。CSD把反馈转为密集的Token级监督,补充稀疏任务奖励,使全部九种评测用户模型下的表现进一步改善。

MIMESIS:通过用户模拟器训练交互式Agent:论文原图
图 3:我们提出的方法的概述。我们将用户模拟器学习与模拟器驱动的代理后期训练结合起来。第一阶段通过用户端中期训练、ThoughtTrace 推理监督以及具有现实行为目标的联合强化学习来训练 MIMESIS。第二阶段冻结学习的模拟器,并使用它为智能体 RL 生成多轮经验。智能体仅对可观察的对话采取行动,而模拟器生成的想法和反应为教练提供特权、仅限训练的反馈,教练将其转化为对智能体的密集指导。