论文

Self-CTRL:通过强化学习进行自我一致性训练

Self-CTRL: Self-Consistency Training with Reinforcement Learning

模型训练强化学习

摘要

忠实描述自身行为的语言模型 (LM) 可以更容易地被用户审核、理解和信任。本文描述了强化学习的自我一致性训练(Self-CTRL),这是一种通过更新解释以更好地预测行为或更新行为以更好地匹配解释来优化 LM 的自我解释和相关输入行为之间的一致性的方法。我们将我们的方法应用于两个领域。首先,我们研究了一个正式的概率推理任务,其中 LM 必须学会模仿一系列有偏差的采样器,并评估它们报告相关偏差的能力。我们发现一致性训练提高了自我报告和行为测量的潜在偏差之间的相关性,在一组保留分布上从 $R^2=0.24$ 提高到 $R^2=0.64$,与直接 真值 监督的泛化相匹配。其次,我们研究了一个宪法人工智能领域,其中 LM 必须描述何时拒绝或遵守用户请求。在这里,Self-CTRL 生成的规则忠实地描述了模型对保留请求的行为,将第三方审计模型的拒绝预测从 $36\%$ 提高到 $92\%$。另一方面,行为更新改善了一致性,将 HarmBench 失败率从 $15.0\%$ 降低到 $0.5\%$,而不会大幅增加对无害提示的拒绝。通过协调解释和行为,我们的工作为训练人工智能模型变得更安全、更透明和更可控提供了通用方法。