论文

强化学习能提升LLM智能体的泛化能力吗?一项实证研究

Can RL Improve Generalization of LLM Agents? An Empirical Study

智能体系统模型训练强化学习Agent任务评测Agentic RL

摘要

强化微调(RFT)在训练LLM智能体基于环境反馈执行多轮决策方面展现出前景。然而,大多数现有评估基本局限于域内:训练与测试在同一环境甚至相同任务上进行。在现实部署中,智能体可能要在具有不同背景知识、观测空间与动作接口的未见环境中运行。为刻画RFT在此类偏移下的泛化表现,我们沿三个轴开展系统研究:(1) 同一环境内跨任务难度的泛化;(2) 向未见环境的跨环境迁移;(3) 量化迁移与遗忘的序列式多环境训练。结果表明,RFT在同一环境内能很好地跨任务难度泛化,但向未见环境的迁移较弱,这与语义先验以及观测/动作接口的偏移相关。相比之下,序列式训练带来可观的下游收益且上游遗忘极小,跨环境混合训练则改善了整体平衡。我们进一步提供了细致的分析与更深入的洞见,期望这项工作能帮助社区开发并部署可泛化的LLM智能体。

强化学习能提升LLM智能体的泛化能力吗?一项实证研究:论文配图
图 1:我们研究的三个轴的概述。表 1:我们研究的每种环境的特征。列“DEN.”、“VAL.”、“ACT.”、“KNWL.”和“STR”。分别表示奖励是否密集、动作验证是否严格、每步是否提供有效的动作列表、是否需要世界知识以及是否结构化观察。环境沿着这些维度变化。