论文

行为线索推理:经监督提升推理效率与安全的可监视推理

Behavior Cue Reasoning: Monitorable Reasoning Improves Efficiency and Safety through Oversight

模型训练监督微调与指令调优

摘要

大语言模型 (LLM) 中的推理对监督提出了挑战,因为许多不一致的行为在推理结束之前不会浮现出来。为了解决这个问题,我们引入了行为线索推理,使 LLM 推理更加可控和可监控。行为线索是特殊的token序列,模型经过训练,在特定的隐式和显式行为之前立即发出,充当双重目的信号和控制杆。当使用强化学习微调较弱的外部监视器以进行推理监督时,仅行为线索显示的信息的压缩视图足以让监视器在解决复杂数学问题时修剪多达 50% 的浪费推理标记。当在过度违反约束导致失败的环境中使用几乎最佳的基于规则的监视器时,我们可以从 80% 的推理跟踪中恢复安全操作,否则将以建议不安全操作结束,成功率从 46% 增加了一倍多,从 46% 增加到 96%。通过对两个模型系列和三个领域的评估,我们表明推理可以提高推理的可监控性和可控性,而不会影响性能。更广泛地说,我们的工作通过展示如何训练受监控模型本身来更容易地进行监督推理,从而推进可扩展的监督。代码发布于 https://github.com/christopherzc/text-games

行为线索推理:经监督提升推理效率与安全的可监视推理
图 1:我们从基本参与者模型 (1) 中获取推理轨迹,并通过截断推理、附加停止短语并允许模型生成答案 (2) 来得出每一步的即时工作答案。工作答案经过过滤,以模拟仅在更改时才出现的工作答案的行为,并通过行为提示嵌入回推理跟踪中 (3)。 SFT (4) 后,行为线索推理模型采用这种答案报告行为,为外部监督监视器创建理想的决策点。在效率监控中,一旦正确的最终答案出现,监控器就会优化停止。在安全监控中,监控者试图通过持续推理来防止不安全行为的发生。在安全执行中,监控器会记录要实施的最新安全操作,从而进行安全的不安全推理。