论文

VSPO:行为控制的向量引导策略优化

VSPO: Vector-Steered Policy Optimization for Behavioral Control

模型训练强化学习

摘要

现代语言模型通常需要优化主要的准确性目标,同时还要适应次要的行为偏好,例如冗长、宜人性或响应中的技术专业水平。在实践中,基本模型可能很少或根本不表现出所需的行为。因此,赋予模型目标行为会产生稀疏行为奖励瓶颈。为了解决此类多目标问题,我们引入了向量引导策略优化(VSPO),它采用与目标行为相关的引导向量来控制生成的采样轨迹的行为强度。 VSPO 是通过修改 GRPO 来获得具有不同转向强度的示例卷展。此过程可以解释为 同策略 潜在自 蒸馏 过程,其中模型内化其转向向量。通过改变转向强度,VSPO 对罕见行为进行上采样并丰富采样轨迹多样性,从而缓解稀疏奖励问题并加速策略优化。通过综合理论和实验,我们确定 VSPO 与普通奖励塑造和其他替代方法相比具有有利的特性。具体来说,在强盗抽象下,当转向引起的分布与目标行为充分一致时,VSPO 可以比奖励形状的 GRPO 实现更好的迭代复杂性。我们跨多个推理基准(包括 MATH 和 MMLU-Pro)评估 VSPO 的四个目标行为:解释专业知识、信心表达、对误导性上下文的鲁棒性以及响应冗长。我们的结果表明,与奖励塑造、教师跟踪 蒸馏 和基于指导的基线相比,VSPO 持续改进对目标行为的控制,同时保持或提高任务准确性。