论文

从静态上下文到校准交互式RL:用对齐模拟器缓解多轮对话中的分布偏移

From Static Context to Calibrated Interactive RL: Mitigating Distribution Shift in Multi-turn Dialogue with Aligned Simulator

模型训练强化学习Agentic RL

摘要

研究社区的一个长期目标是开发高度交互式的基于LLM的对话智能体。近期研究要么基于固定离线日志优化策略(静态上下文强化学习),要么使用基于提示的模拟器(交互式强化学习)。本文从理论上证明,两种范式都从根本上受限于上下文分布偏移——即训练时观察到的对话历史与真实对话中遇到的对话历史之间的失配。这种偏移随对话轮数呈二次方累积,严重降低对话质量。具体而言,我们将这种偏移归因于两个不同来源:(i) 策略诱导偏移,源于在静态历史上训练而非在自生成轨迹上训练;(ii) 模拟器诱导偏移,源于模拟行为与真实人类行为之间的差异。为应对这些挑战,我们提出校准交互式强化学习(Calibrated Interactive RL),一个将交互式强化学习与模拟器对齐相耦合的统一框架。通过让模拟器与人类交互模式对齐,我们的方法缩小了sim-to-real差距并缓解了累积性分布偏移。在多个对话任务上的实验证实了我们的理论分析:(i) 交互式强化学习通过缓解策略分布偏移显著优于静态上下文基线;(ii) 用我们的对齐方法校准模拟器进一步弥合sim-to-real差距,取得最先进的下游性能。

从静态上下文到校准交互式RL:用对齐模拟器缓解多轮对话中的分布偏移:论文配图
图 1:多轮对话的强化学习框架比较。 (a) 伪多轮强化学习使用静态离线对话日志来优化策略,其中模型在固定的历史上下文中调整其操作,而不生成先前的轮次,从而导致分布转移。 (b) 真正的多轮强化学习(我们的)通过两个阶段的过程闭合交互循环:(1) 用户模拟器训练,其中模拟器与人类参考数据明确对齐,以最大限度地减少模拟器与人类之间的差距; (2) 策略训练,通过与对齐模拟器的动态、多轮交互来优化代理,确保对复合错误的鲁棒性。