论文
大型推理模型中的可监控性配置
Monitorability Disposition in Large Reasoning Models
摘要
监控大型推理模型 (LRM) 的思维链 (CoT) 是检测现实实践中不当行为的常用方法。然而,当前的监控是被动的:单独的模型仅在执行后检查会话。这意味着伤害可能在被发现之前就已经发生了。一个积极的替代方案是让模型在发生不当行为时自我报告。然而,模特们是否愿意这样做还不得而知。我们引入“可监控性配置”:模型愿意在必要时使其自身可监控并在整个推理过程中保持监控。我们将其衡量为模型通过工具调用向可用监控通道自我报告其自身不当行为的有保证案例的比例。我们针对三种不当行为(阿谀奉承、奖励黑客和偏见)评估了 4 个 LRM,同时改变了可用的监控器(人工智能和人类)以及使用监控工具的压力。我们发现,当工具的使用是可选的时,模型平均仅在大约 16% 的有保证的情况下进行自我报告。增加工具使用压力并不能改善重要的报告:高度严重的不当行为永远不会自我报告。模特们还会系统地选择他们认为最不严格的监控器。总的来说,我们将可监控性配置视为模型可监控性的一个新影响因素:当足够强时,它会让模型在整个推理过程中寻求可监控性。
