论文

当思维链知道得更多:多轮推理模型的失败模式

When the Chain of Thought Knows Better: Failure Modes in Multi-Turn Reasoning Models

模型评测安全与风险评测

摘要

多轮推理模型中的失败在很大程度上对于最终分数评估是不可见的。模型可以在长时间对话的早期锁定不安全的立场,但其最终回合的拒绝率可能与稳健对齐的基线无法区分。为了揭示这些隐藏的时间动态,我们提出了跟踪级诊断 - CoT-Output 2x2 安全矩阵。该框架沿着两个独立轴(内部推理和可见输出)标记每个回合,产生四个操作上定义的故障单元:稳健对齐、对齐伪造、明显越狱,以及我们称之为上下文注入失败的独特故障模式(其中 CoT 保持安全推理,但可见输出产生伤害,突出了推理不忠实的多回合表现)。我们在五个监督条件下针对固定攻击者评估了三个提炼的推理目标,收集了有关信息危险场景的 6750 个回合级观察结果。我们的分析揭示了两个可重现的漏洞:监督悖论,其中明确的监控线索反而增加了对齐伪造率,而不是抑制它们;以及上下文注入失败,其中模型尽管内部状态安全,但仍锁定不安全的外部输出。我们发布了多轮对话和 CoT 轨迹的完整数据集,以支持后续的轨迹诊断研究。

当思维链知道得更多:多轮推理模型的失败模式:论文配图
(a) 基线(无监督框架)(b) 观看(显式监控)(c) 未观看(显式隐私)(d) 免部署(培训监督)(e) 付费部署(不受监控的沙箱)图 1:所有实验条件下的对话漂移。 30 个独立种子在 15 轮对抗性对话中逐轮安全状态。