论文
对齐、正交或冲突:我们什么时候可以安全地优化思想链?
Aligned, Orthogonal or In-conflict: When can we safely optimize Chain-of-Thought?
摘要
思想链 (CoT) 监控(即自动化系统监控 LLM 的 CoT)是一种有效监督人工智能系统的有前途的方法。然而,模型的 CoT 帮助我们监督模型的程度(CoT 的可监控性)可能会受到训练的影响,例如模型学习隐藏其推理的重要特征。我们提出并实证验证了一个概念框架来预测这种情况何时以及为何发生。我们将 LLM 后训练 建模为 RL 环境,其中奖励分解为两项:一项取决于最终输出,另一项取决于 CoT。我们的框架允许我们在训练之前将这两个术语分类为“对齐”、“正交”或“冲突”。我们预测,使用冲突术语进行训练将降低可监控性,正交术语不会影响它,而对齐术语将改善它。为了验证我们的框架,我们使用它对一组 RL 环境进行分类,在这些环境中训练 LLM,并评估训练如何影响 CoT 可监控性。我们发现(1)使用“冲突”奖励条款进行训练会降低 CoT 可监控性,(2)优化冲突奖励条款很困难。