论文
优化政策学习内容:可恢复性推广干预学习
Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning
摘要
无批评者基于群体的强化学习已成为 后训练 大语言模型 的可扩展方法。然而,大多数现有方法为每个任务和轨迹状态分配相同数量的采样轨迹,即使某些采样轨迹提供比其他采样轨迹更有用的学习信号。最近的工作已经开始将轨迹生成视为适应性决策,但仍然存在两个重要的局限性。首先,干预策略通常基于固定启发式,因此无法随着训练期间政策的变化而调整。其次,这些方法通常只决定生成多少条采样轨迹,而没有明确控制干预的位置和方式。为了解决这些限制,我们提出了可恢复性感知干预学习(RAIL),这是一种训练时间框架,可以学习如何根据每次干预产生的改进来生成采样轨迹。 RAIL 将干预选择建模为在线上下文多臂赌博机问题,并使用通过影子到实时过程收集的干预跟踪来训练可恢复性控制器。这使得控制器能够在底层策略不断发展的同时不断学习。我们从有效性、适应性、表现力和效率方面评估 RAIL。在多种设置中,RAIL 在有限的轨迹采样预算下持续提高性能。这些结果表明,可恢复性干预提供了一种原则性的方法来生成更多信息和更少冗余的采样轨迹,从而在 后训练 期间产生更强的学习信号。