论文
强化学习能提升LLM智能体的泛化能力吗?一项实证研究
Can RL Improve Generalization of LLM Agents? An Empirical Study
摘要
强化微调(RFT)在训练LLM智能体基于环境反馈执行多轮决策方面展现出前景。然而,大多数现有评估基本局限于域内:训练与测试在同一环境甚至相同任务上进行。在现实部署中,智能体可能要在具有不同背景知识、观测空间与动作接口的未见环境中运行。为刻画RFT在此类偏移下的泛化表现,我们沿三个轴开展系统研究:(1) 同一环境内跨任务难度的泛化;(2) 向未见环境的跨环境迁移;(3) 量化迁移与遗忘的序列式多环境训练。结果表明,RFT在同一环境内能很好地跨任务难度泛化,但向未见环境的迁移较弱,这与语义先验以及观测/动作接口的偏移相关。相比之下,序列式训练带来可观的下游收益且上游遗忘极小,跨环境混合训练则改善了整体平衡。我们进一步提供了细致的分析与更深入的洞见,期望这项工作能帮助社区开发并部署可泛化的LLM智能体。
