论文
行为线索推理:经监督提升推理效率与安全的可监视推理
Behavior Cue Reasoning: Monitorable Reasoning Improves Efficiency and Safety through Oversight
摘要
大语言模型 (LLM) 中的推理对监督提出了挑战,因为许多不一致的行为在推理结束之前不会浮现出来。为了解决这个问题,我们引入了行为线索推理,使 LLM 推理更加可控和可监控。行为线索是特殊的token序列,模型经过训练,在特定的隐式和显式行为之前立即发出,充当双重目的信号和控制杆。当使用强化学习微调较弱的外部监视器以进行推理监督时,仅行为线索显示的信息的压缩视图足以让监视器在解决复杂数学问题时修剪多达 50% 的浪费推理标记。当在过度违反约束导致失败的环境中使用几乎最佳的基于规则的监视器时,我们可以从 80% 的推理跟踪中恢复安全操作,否则将以建议不安全操作结束,成功率从 46% 增加了一倍多,从 46% 增加到 96%。通过对两个模型系列和三个领域的评估,我们表明推理可以提高推理的可监控性和可控性,而不会影响性能。更广泛地说,我们的工作通过展示如何训练受监控模型本身来更容易地进行监督推理,从而推进可扩展的监督。代码发布于 https://github.com/christopherzc/text-games
