论文

上下文碎片到达时的多轮推理:可扩展分片和内存增强强化学习

Multi-Turn Reasoning When Context Arrives in Pieces: Scalable Sharding and Memory-Augmented RL

模型训练强化学习

摘要

当用户在多个对话回合中透露关键任务信息时,尽管上下文完全可用,但 LLM 的准确性仍会下降高达 65%。我们表明,通过训练模型来维持紧凑的滚动记忆而不是关注不断增长的历史,可以大大减轻这种“对话中迷失”的退化。为了使这种训练具有可扩展性,我们引入了一种低成本的分片管道,可将单轮 QA 数据集转换为多轮碎片信息片段,从而无需花费数小时的手动注释。我们的内存增强策略仅在分片 GSM8K 上进行训练,显着提高了多轮精度,并将零样本推广到更难的数学和域外长上下文 QA。此外,即使在测试时给出完整历史记录,记忆训练模型的性能也优于完整历史基线,这表明学习压缩比单独接触完整上下文能产生更强大的增量推理。