论文
训练大语言模型完成长程任务:任务视界长度的实证研究
On Training Large Language Models for Long-Horizon Tasks: An Empirical Study of Horizon Length
摘要
大语言模型(LLM)作为通过延长序列的环境交互解决任务的交互智能体展现出前景。既往工作多聚焦系统级优化或算法改进,而任务视界长度在塑造训练动力学中的作用仍知之甚少。本文通过受控任务构造对视界长度做系统实证研究。具体地,我们构造这样的受控任务:智能体面对完全相同的决策规则与推理结构,仅成功完成所需的动作序列长度不同。结果揭示:仅增加视界长度本身就构成训练瓶颈——由探索困难与贡献归因挑战驱动,引发严重的训练不稳定。我们证明视界缩减是应对该限制的关键原则:稳定训练并在长程任务上取得更好性能。此外,我们发现视界缩减与更强的跨视界泛化相关:在缩减视界下训练的模型在推理时能更有效地泛化到更长视界变体,我们称之为视界泛化(horizon generalization)。
