论文

少缴泛化税:LLM智能体强化学习训练的跨域泛化研究

Paying Less Generalization Tax: A Cross-Domain Generalization Study of RL Training for LLM Agents

模型训练强化学习Agentic RL

摘要

通用型LLM智能体常在狭窄的环境集合上进行后训练,却被部署在远更广泛的未见领域中。在这项工作中,我们研究当最终测试领域未知时Agentic后训练的挑战。具体而言,我们分析强化学习(RL)环境和建模选择的哪些属性对域外性能影响最大。首先,我们识别出与跨域泛化强相关的两个环境轴:(i)状态信息丰富度,即智能体需从状态处理的信息量;(ii)规划复杂度,通过基座策略下的目标可达性和轨迹长度估计。值得注意的是,领域真实感和文本层面相似度并非主要因素;例如,简单的网格世界Sokoban比更真实的ALFWorld在SciWorld上带来更强的泛化。受这些发现启发,我们进一步表明,仅增加状态信息丰富度即可有效提升跨域鲁棒性。我们提出一种低开销且广泛适用的随机化技术:向状态添加少量干扰性的、与目标无关的特征,在不改变任务的情况下使状态更丰富。除环境侧属性外,我们还考察若干建模选择:(a)SFT预热或中期训练有助于防止RL期间的灾难性遗忘,但会损害对中期训练数据组合未包含领域的泛化;(b)在RL期间开启逐步思考虽不总能提升域内性能,但对保持泛化起关键作用。