论文
稳定价值冲突解决的几何视角
A Geometric Perspective on Stabilizing Value Conflict Resolution
摘要
当使用人类反馈强化学习 (RLHF) 的压缩标量奖励进行训练时,大语言模型 (LLM) 经常难以解决价值冲突。为了应对这一挑战,我们研究了思想链 (CoT) 推理如何帮助提高该领域的性能。从几何角度来看,我们表明 CoT 与进一步平滑模型最尖锐方向的损失景观相关,有助于解决传统标量奖励的优化不稳定性。我们还通过相关下游基准证明,重视以冲突为中心的 CoT 可以推广到不同类型的道德推理,表明该 CoT 有潜力成为更好道德推理的有效机制。为了充分利用这一潜力,我们创建了一种新的以价值冲突为中心的 CoT 设计,进一步平滑损失景观的最尖锐方向并提高道德推理性能。这一发现表明,显式修改和改进推理动态的设计为提高具有复杂价值冲突的用户请求的模型性能提供了一条有前途的途径,从而推进 LLM 中的多元对齐。