论文

大型推理模型中的可监控性配置

Monitorability Disposition in Large Reasoning Models

模型评测安全与风险评测

摘要

监控大型推理模型 (LRM) 的思维链 (CoT) 是检测现实实践中不当行为的常用方法。然而,当前的监控是被动的:单独的模型仅在执行后检查会话。这意味着伤害可能在被发现之前就已经发生了。一个积极的替代方案是让模型在发生不当行为时自我报告。然而,模特们是否愿意这样做还不得而知。我们引入“可监控性配置”:模型愿意在必要时使其自身可监控并在整个推理过程中保持监控。我们将其衡量为模型通过工具调用向可用监控通道自我报告其自身不当行为的有保证案例的比例。我们针对三种不当行为(阿谀奉承、奖励黑客和偏见)评估了 4 个 LRM,同时改变了可用的监控器(人工智能和人类)以及使用监控工具的压力。我们发现,当工具的使用是可选的时,模型平均仅在大约 16% 的有保证的情况下进行自我报告。增加工具使用压力并不能改善重要的报告:高度严重的不当行为永远不会自我报告。模特们还会系统地选择他们认为最不严格的监控器。总的来说,我们将可监控性配置视为模型可监控性的一个新影响因素:当足够强时,它会让模型在整个推理过程中寻求可监控性。

大型推理模型中的可监控性配置的原论文方法或结果图
图 1:三个主要指令的工具调用率和参与率:可选指令、强制指令和激励指令。根据可选指令,模型仅在认为有必要时才调用工具,四个测试的 LRM 平均仅在大约 16% 的保证案例中进行自我报告。强制和激励工具的使用会提高参与度并导致过度自我报告。然而,这两项指令都没有改善最重要的报告:中度或高度严重的案件。总体而言,模型始终表现出低可监控性;工具使用增加,但可监控性却没有增加。