论文

技能重用作为代理强化学习中的压缩

Skill Reuse as Compression in Agentic RL

模型训练强化学习

摘要

经过强化学习 (RL) 训练的 大语言模型 智能体通常会学习脆弱的、特定于任务的捷径。我们假设,当智能体的成功轨迹在结构上可压缩、分解为一小组可重用的抽象模式时,它们的泛化能力会更好。为了形式化这一点,我们引入了 ReuseRL,它将代理强化学习基于最小描述长度 (MDL) 原则。 ReuseRL 从成功的轨迹中提取共享技能字典,并通过分段成本增强 RL 目标,明确惩罚编码不佳的特殊行为。我们证明了 PAC-Bayes 界限,保证从成功轨迹中提取的字典限制了未来成功行为的预期描述长度。在 ALFWorld、TextWorld-Cooking 和 Countdown-Stepwise 中,ReuseRL 比普通 GRPO 和强大的回合长度基线提高了分发内和分发外的成功率。