论文

状态承诺学习:训练语言模型以区分计算和记忆

State commitment learning: training language models to distinguish computation from memory

模型训练强化学习

摘要

推理语言模型不区分用于计算的标记和构成持久状态的标记:一旦生成,所有隐藏的想法都会保留在上下文中并影响未来的预测。因此,下游推理可能依赖于失败的尝试、死胡同以及以后不应该安全依赖的私人临时工作。我们将这种现象重新定义为一个新的训练目标,即状态承诺学习:训练模型明确区分应作为持久状态提交的信息与可以丢弃的临时计算。我们定义了一个反事实标准,即持久状态充分性,这使得在隐藏的想法被删除后答案是否仍然可用是可训练和可测量的。然后,我们提出了反事实擦除强化学习(CERL),它在相同的前缀下评估保留隐藏想法的路径和擦除它们的路径,并且仅当擦除路径保持正确时才给予奖励。我们还引入了擦除依赖协议,并在数学、长链逻辑、科学 QA 和多轮工具使用评估方面表明,CERL 大大减少了对隐藏想法的答案依赖,而不牺牲准确性,始终优于仅正确性 RL 和长答案 SFT 基线。