论文

通过基于代理的思想链调整进行长上下文推理

Long-Context Reasoning Through Proxy-Based Chain-of-Thought Tuning

模型训练强化学习

摘要

最近的 大语言模型 支持高达 1000 万个词元的输入,但它们在需要复杂推理的长上下文任务上表现不佳。此类任务可以仅使用输入的子集(代理上下文)而不是完整序列来解决。尽管共享相同的底层推理过程,但模型在代理上下文和完整上下文之间表现出显着的性能差异。为了改进长上下文推理,我们提出了 ProxyCoT,这是一种新颖的训练框架,可将推理能力从短代理上下文转移到完整的长上下文。具体来说,我们首先通过强化学习或从更大的教师模型中获得 蒸馏 在代理上下文上获得高质量的思想链推理痕迹,然后使用有监督的 微调 将生成的痕迹放在完整的长上下文中。跨不同数据集的实验表明,ProxyCoT 始终优于强大的基线,同时减少了计算开销。此外,使用 ProxyCoT 训练的模型将其长上下文推理能力推广到域外任务。