论文
通过言语反馈强化人类行为模拟
Reinforcing Human Behavior Simulation via Verbal Feedback
摘要
人类从口头反馈中学习社会规范和行为(例如,父母说“这很粗鲁”,或者朋友解释“这就是为什么会受伤”)。然而,从 LLM 的反馈中学习主要集中在代码和数学等领域,在这些领域,强化学习奖励可以直接验证并压缩为标量值。随着 LLM 越来越多地用于模拟人类行为,例如代表用户、患者、学生和其他角色,迫切需要使它们变得更像人类,这需要接受一种根本不同的信号:口头、主观和多方面的反馈。我们提出了 DITTO,这是一种通过将口头反馈视为强化学习中的一流信号来训练的模型。每次采样轨迹后,DITTO 都会收到口头反馈并生成以反馈为条件的改进采样轨迹;这两个输出均与 GRPO 联合优化,将口头指导提炼到基本策略中,无需在测试时提供反馈。我们还提出了 SOUL(类人行为模拟健身房),这是一个统一的基准和训练数据套件,涵盖 6 个类别的 10 项任务:心理理论、角色扮演、社交技能、学习者模拟、用户模拟和角色模拟。 DITTO 比基本模型平均提高了 36%,并且在 10 个 SOUL 基准测试中的 6 个上超过了 GPT-5.4,这表明带有口头反馈的 RL 是训练 LLM 模拟人类行为的一个有前途的方向。