论文

用于情境强化学习的任务专业化 微调

Task Specialization Fine-Tuning for Contextual Reinforcement Learning

模型训练强化学习

摘要

情境强化学习 (CRL) 旨在通过最大化相关任务的情境空间中的任务覆盖范围来推广经典强化学习。虽然之前的工作经常从头开始训练,并依赖于单个策略的多任务学习或策略性地训练多个策略,但我们主张采用统一的替代方案:预训练具有良好初始性能的单个策略,然后是用于任务专业化的 微调 多个策略。然而,这种新范式带来了独特的挑战,例如异质边际收益和样本效率低下。这就提出了一个关键的研究问题:给定预训练策略和有限的预算,每个任务区域应该接收多少 微调 才能实现样本高效的 CRL?为此,我们提出了任务专业化 微调 (TSFT),这是一个在线框架,它通过简单的参数模型预测 微调 性能,并通过整数线性规划精确解决由此产生的离散预算分配问题。跨不同决策领域(包括组合优化、连续控制和 LLM 微调)的广泛实验表明,TSFT 在任务覆盖率方面显着优于基线,并接近预言机性能。我们的工作为基于模型的 CRL 指明了新方向,与现代预训练微调时代保持一致。