论文
使用图灵奖励学习用户模拟器
Learning User Simulators with Turing Rewards
摘要
学习在交互环境中模拟人类用户可以促进代理助理的训练、个性化系统的评估、社会科学研究等。现有方法通常通过训练 大语言模型 (LLM) 来匹配单个 真值 响应来实现这一点,或者通过最大化对数概率或通过使用相似性奖励。相反,我们提出 Turing-RL:一种基于图灵测试的强化学习方法,用于训练用户模拟器模型。 Turing-RL 使用带有 LLM 判断的判别性图灵奖励来对生成的响应与给定用户历史的真实用户的难以区分的程度进行评分,并且用户模拟器 LLM 学习生成与用户通过此类奖励可能说出的内容难以区分的响应。在两个不同的领域(对话聊天和 Reddit 论坛讨论)中,我们发现 Turing-RL 在 LLM 和人类评估指标上始终优于基线方法。我们的研究表明,对于学习用户模拟器来说,优化不可区分性而不是响应匹配是有效的。