论文
逆强化学习通过模仿人类来帮助人工智能协调一致
Inverse RL Helps Align AI by Imitating Humans
摘要
语言模型对齐的目的是使模型行为可靠地反映所需的属性,例如有用性、安全性和指令遵循性。当前的方法通常使用有监督的 微调 进行演示或强化学习,并从验证者或人类反馈中获得奖励。这些范式留下了一个尚未得到充分探索的重要问题:仅演示能否产生可以检查、重用和优化 同策略 以调整 AI 的隐性奖励?在逆强化学习的推动下,我们引入了通过演示估算的预计对齐奖励(PARED)。 PARED 将专家演示的隐式奖励恢复为一小组响应级别特征的显式函数,由轻量级判别器学习,该判别器将演示与该特征空间中策略自身的样本分开。与标准奖励模型不同,PARED 不需要特定于任务的偏好注释:演示提供特定于任务的监督,可以通过人工智能反馈作为额外的监督维度来增强监督。通过涉及推理时间重排序和对抗性 同策略 RL 的实验,我们表明恢复的奖励改进了没有监督损失的基本策略,并且在标准监督 微调 后优化时产生进一步的收益。此外,我们证明 PARED 可用于上下文对齐,其中可以根据不同受众的偏好定制单个策略。