论文

迈向广泛且持续有益模型的强化学习

Reinforcement Learning Towards Broadly and Persistently Beneficial Models

模型训练强化学习

摘要

随AI系统部署到日益多样、高风险的设定——模型对齐必须泛化到训练所见任务与领域之外。这对强化学习(RL)尤其重要——RL可能经奖励作弊、欺骗或其他非预期策略引入意外失对齐。我们研究:在现实领域实例化的有益行为RL能否产生超出训练分布的广泛且持续的对齐泛化。我们构建为度量与训练有益特质(如真实、公平、风险意识与可纠正性)设计的现实情境数据集——横跨健康、科学与教育等多样领域。然后在此数据集上以RL训练模型——并在超过50个独立的对齐与有益行为基准上评估。对照算力匹配基线——有益特质RL在超80%的分布外基准上提升表现。我们观察到实质的分布外对齐迁移:完全限于健康一个领域的有益行为RL干预在非健康对齐评估上产生广泛改进——包括更低的奖励作弊、欺骗与一般失对齐。最后——我们研究对齐持续性:行为在试图把模型转向失对齐时是否保持稳健对齐。有益特质RL训练的模型展现更强持续性——包括对对抗提示与有害微调的更强抵抗;分离这些效应来源需进一步工作。这些结果提示:在现实领域强化有益行为的RL能产生与人类繁荣更稳健对齐的模型。

迈向广泛且持续有益模型的强化学习:论文配图
图 5:一致性和效益评估的定性示例。此处显示的示例因空间原因而被缩短,并且在某些情况下将较长的多轮对话压缩为单个用户提示。