论文
监控内部独白:探测轨迹揭示推理动态
Monitoring the Internal Monologue: Probe Trajectories Reveal Reasoning Dynamics
摘要
大型推理模型 (LRM) 通过其思想链 (CoT) 推理引入了安全监控的新机会。然而,CoT 并不总是忠实于模型的最终输出,从而削弱了其作为监控工具的可靠性。为了解决这个问题,我们研究了 LRM 的隐藏表示,以确定是否可以从提示和 CoT 表示中预测未来的行为。通过评估每个生成的标记的探针,我们构建了探针轨迹,即概念概率在整个推理过程中的持续演化。我们发现,在整个轨迹上进行检查时,未来模型的行为比单个静态预测更容易区分。为了表征这些时间动态,我们提取了捕获波动性、趋势和稳态行为的信号处理特征,从而显着改善了未来模型状态的分离。我们还提出了两种方法论见解。首先,基于模板的训练数据与动态生成的模型响应几乎相同,从而消除了昂贵的初始推理和标记的需要。其次,池化操作的选择至关重要:平均池化和最后词元方法崩溃到接近随机的性能,而最大池化实现高达 95% AUROC 并产生稳定的探测轨迹。使用安全和数学领域的四个数据集和四个推理模型,我们证明轨迹特征编码特定于任务的动态,从而提高结果的可分离性。这些发现将探测轨迹确立为监测 LRM 行为的补充框架。警告:本文包含可能有害的内容。