论文
当思维链知道得更多:多轮推理模型的失败模式
When the Chain of Thought Knows Better: Failure Modes in Multi-Turn Reasoning Models
摘要
多轮推理模型中的失败在很大程度上对于最终分数评估是不可见的。模型可以在长时间对话的早期锁定不安全的立场,但其最终回合的拒绝率可能与稳健对齐的基线无法区分。为了揭示这些隐藏的时间动态,我们提出了跟踪级诊断 - CoT-Output 2x2 安全矩阵。该框架沿着两个独立轴(内部推理和可见输出)标记每个回合,产生四个操作上定义的故障单元:稳健对齐、对齐伪造、明显越狱,以及我们称之为上下文注入失败的独特故障模式(其中 CoT 保持安全推理,但可见输出产生伤害,突出了推理不忠实的多回合表现)。我们在五个监督条件下针对固定攻击者评估了三个提炼的推理目标,收集了有关信息危险场景的 6750 个回合级观察结果。我们的分析揭示了两个可重现的漏洞:监督悖论,其中明确的监控线索反而增加了对齐伪造率,而不是抑制它们;以及上下文注入失败,其中模型尽管内部状态安全,但仍锁定不安全的外部输出。我们发布了多轮对话和 CoT 轨迹的完整数据集,以支持后续的轨迹诊断研究。
