论文

C-Instrument:使用宪法网格仪器自动生成 RL 数据和爬山

C-Instrument: Automating RL Data Generation and Hillclimbing with a Constitution-Grid Instrument

模型训练合成数据

摘要

在 RL 对齐中,相互冲突的目标很常见,并且对这些目标进行数据高效的训练非常困难。使用强化学习训练安全卫兵意味着优化两个相互冲突的目标:捕捉真正的伤害,并且不拒绝善意的提示。我们的发现是,过度拒绝提高了 22.4% 到 12.8%,而对抗性攻击的拒绝不足则默默恶化了 0.27 到 0.33。我们提出了 C-Instrument,一种生成 RL 训练数据的构成网格数据工具,以及 C-LIM,一种决定每个单元移动的每单元可学习性分数:修剪、致密、修改、扩展。 C-LIM 在花费任何训练预算之前标记无用数据区域:187 个非目标行购买了零增益,并且我们的方法将同一区域的学习影响从 0.733 提升到 0.80。准则和章程是开源的。