论文
政策梯度引导:行为目标的干预
Policy Gradient Steering: Interventions from Behavioral Objectives
摘要
激活引导已在 大语言模型 中出现,作为在推理时动态更改模型行为的轻量级替代方案。然而,我们表明,现有的引导方法甚至无法在两路网格世界环境中引导简单的策略。为了解决这个限制,我们提出了策略梯度转向(PGS),它将转向作为强化学习问题。 PGS 通过一小组展示或演示累积临时行为目标的梯度,以构建可移动的任务向量。我们首先在两路网格世界环境中演示 PGS 的校准和可逆性。然后,我们使用国际象棋谜题,单独和组合地评估独立拟合的 PGS 向量,发现兼容的战术目标可以建设性地积累。最后,在竞技足球中,我们证明 PGS 可以改变特定的球队行为,并且其影响可以在对手之间传递。总之,这些结果表明,政策梯度为跨不同决策领域构建临时和可组合的行为适应提供了一个自然的界面。