论文

训练大语言模型完成长程任务:任务视界长度的实证研究

On Training Large Language Models for Long-Horizon Tasks: An Empirical Study of Horizon Length

模型训练强化学习

摘要

大语言模型(LLM)作为通过延长序列的环境交互解决任务的交互智能体展现出前景。既往工作多聚焦系统级优化或算法改进,而任务视界长度在塑造训练动力学中的作用仍知之甚少。本文通过受控任务构造对视界长度做系统实证研究。具体地,我们构造这样的受控任务:智能体面对完全相同的决策规则与推理结构,仅成功完成所需的动作序列长度不同。结果揭示:仅增加视界长度本身就构成训练瓶颈——由探索困难与贡献归因挑战驱动,引发严重的训练不稳定。我们证明视界缩减是应对该限制的关键原则:稳定训练并在长程任务上取得更好性能。此外,我们发现视界缩减与更强的跨视界泛化相关:在缩减视界下训练的模型在推理时能更有效地泛化到更长视界变体,我们称之为视界泛化(horizon generalization)。

训练大语言模型完成长程任务:任务视界长度的实证研究:论文配图
图 1:我们的贡献摘要。在这项工作中,我们从以视野为中心的角度研究了长视野 LLM 代理的训练,并将视野长度确定为基本瓶颈。我们表明,视野缩减可以稳定强化学习,并增强在具有类似推理难度的较长任务上的视野泛化趋势。