论文
打破上下文惯性:用单轮锚点的强化学习实现稳定多轮交互
Breaking Contextual Inertia: Reinforcement Learning with Single-Turn Anchors for Stable Multi-Turn Interaction
摘要
虽然大语言模型在单轮提供完整信息时表现出强大的推理能力,但它们在多轮交互中表现出巨大的弱点。具体来说,当信息逐渐揭示或需要更新时,模型经常无法集成新的约束,导致与单轮基线相比性能崩溃。我们将根本原因称为\emph{上下文惯性}:模型严格遵循先前推理轨迹的现象。即使用户在以后的回合中明确提供更正或新数据,模型也会忽略它们,而是更愿意与之前(不正确的)推理路径保持一致。为了解决这个问题,我们引入了 \textbf{R}einforcement \textbf{L}earning with \textbf{S}ingle-\textbf{T}urn \textbf{A}nchors (\textbf{RLSTA}),这是一种通用的训练方法,旨在稳定跨不同场景和领域的多轮交互。 RLSTA 利用模型卓越的单转能力作为稳定的内部锚点来提供奖励信号。通过将多轮响应与这些锚点对齐,RLSTA 使模型能够打破上下文惯性并根据最新信息自我校准其推理。实验表明,RLSTA 显着优于标准微调和基于弃权的方法。值得注意的是,我们的方法表现出强大的跨域泛化能力(例如,从数学到代码),并且即使没有外部验证器也被证明是有效的,这凸显了其在通用领域应用中的潜力。
