论文
从静态上下文到校准交互式RL:用对齐模拟器缓解多轮对话中的分布偏移
From Static Context to Calibrated Interactive RL: Mitigating Distribution Shift in Multi-turn Dialogue with Aligned Simulator
摘要
研究社区的一个长期目标是开发高度交互式的基于LLM的对话智能体。近期研究要么基于固定离线日志优化策略(静态上下文强化学习),要么使用基于提示的模拟器(交互式强化学习)。本文从理论上证明,两种范式都从根本上受限于上下文分布偏移——即训练时观察到的对话历史与真实对话中遇到的对话历史之间的失配。这种偏移随对话轮数呈二次方累积,严重降低对话质量。具体而言,我们将这种偏移归因于两个不同来源:(i) 策略诱导偏移,源于在静态历史上训练而非在自生成轨迹上训练;(ii) 模拟器诱导偏移,源于模拟行为与真实人类行为之间的差异。为应对这些挑战,我们提出校准交互式强化学习(Calibrated Interactive RL),一个将交互式强化学习与模拟器对齐相耦合的统一框架。通过让模拟器与人类交互模式对齐,我们的方法缩小了sim-to-real差距并缓解了累积性分布偏移。在多个对话任务上的实验证实了我们的理论分析:(i) 交互式强化学习通过缓解策略分布偏移显著优于静态上下文基线;(ii) 用我们的对齐方法校准模拟器进一步弥合sim-to-real差距,取得最先进的下游性能。
