论文
KLong:训练面向极长时程任务的LLM智能体
KLong: Training LLM Agent for Extremely Long-horizon Tasks
摘要
本文提出KLong,一个为解决极长时程任务而训练的开源LLM智能体。其原则是先通过轨迹切分SFT冷启动模型,再通过渐进式RL训练扩展能力。具体而言,我们首先用一套完备的SFT方案激活基座模型的基础Agentic能力。随后我们引入Research-Factory,一条通过收集研究论文并构建评估量规来生成高质量训练数据的自动化流水线。利用该流水线,我们构建了数千条从Claude 4.5 Sonnet(Thinking)蒸馏而来的长时程轨迹。为使用这些极长轨迹训练,我们提出新的轨迹切分SFT:保留早期上下文、逐步截断后续上下文,并在子轨迹间保持重叠。此外,为进一步提升长时程任务求解能力,我们提出一种新颖的渐进式RL,把训练安排为多个阶段并逐步延长超时时限。如图1所示,实验证明了KLong的优越性与泛化能力。值得注意的是,我们提出的KLong(106B)在PaperBench上超越Kimi K2 Thinking(1T)11.28%,且性能提升可泛化到SWE-bench Verified与MLE-bench等其他编码基准。