论文
StateTree:通过强化学习增强长期对话推理
StateTree: Enhancing Long-Term Dialogue Reasoning via Reinforcement Learning
摘要
部署为个性化助手的大语言模型必须对长期、不断发展的交互历史进行推理。然而,在长期对话推理中,相关证据分散在各个会话中,偏好可能会随着时间的推移而修改,并且标准的长上下文训练无法解决数据稀缺和计算成本过高的这些挑战。我们提出了 StateTree,这是一种数据驱动的 RL 方法,它从具有可验证的基本事实的稀缺对话构建具有挑战性的辅助任务。 StateTree 通过树结构的路径跟踪任务增强了多会话对话:键值记录跨会话嵌入以形成二叉树。解决任务需要模型通过跨会话检索记录并比较时间戳来解析分支,从根遍历到叶子,然后恢复干扰叶子中隐藏的目标问题。我们应用课程强化学习训练逐步增加树的深度,并引入一种组合变体,其边缘带有步骤级推理片段,训练模型将部分线索组合成连贯的查询。 StateTree 在 10K 词元上下文上进行训练,可以推广到 128K 词元,无需全长 RL 成本,并展现出跨会话检索、时间推理、知识更新和组合多跳推理等功能。 StateTree 的性能优于 SFT 和基于 RL 的基线,同时保留了短上下文一般推理。 StateTree-7B 在 LongMemEval (128k) 上实现了高达 +23.60% 的提升,StateTree-14B 在 LongMemEval 上实现了 59.00% 的准确率,超过了 QwenLong-L1-32B (45.20%)。