论文

意图大声说话:超越响应模仿的可控用户模拟

Intent Speaks Louder: Controllable User Simulation Beyond Response Imitation

模型训练强化学习

摘要

用户模拟器被广泛用作训练和评估交互式助手的可扩展环境。生成下一个用户回合本质上是一对多的:相同的配置文件和对话上下文可以支持具有不同本地交互意图的多个合理的延续。因此,流畅的回应可能会通过不适当的意图来推进对话,例如接受而不是修复。我们的主要见解是,可控的用户模拟应该将下一个用户应该实现的本地交互意图与该意图如何用语言表达分开。我们引入了 UserIDA(用户意图指令对齐),它将交互意图公开为显式的每回合指令。 UserIDA 定义了六路意图接口,通过监督 微调 学习指令条件生成,并在基于组的强化学习期间使用意图校准策略优化。该奖励保留了综合响应质量,同时确保违反意图的候选人在混合组中的排名低于合规的替代方案。在 LMSYS-USP 上,UserIDA 实现了 86.6% 的意图准确度,比最强的专用用户模拟器基准高出 24.3 个百分点,同时提高了语义和风格相似性。在上下文内干预中,它在 91.7% 的评估对话状态中至少实现了六个目标意图中的四个,而最强的外部基线只有 22.9%。这些结果将每回合意图控制建立为用户模拟中响应保真度的补充维度。