论文
推理链未断,答案已屈服:对抗压力下推理模型的轨迹-答案分离
The Chain Holds, the Answer Folds: Trace-Answer Dissociation in Reasoning Models Under Adversarial Pressure
摘要
推理模型在单轮基准上接受评估,却部署于多轮对话之中,用户会对正确答案提出反驳。在持续的对抗压力下,我们发现一种此前未见记录的失效模式:思维链从第一轮到最后一直保持事实正确,而模型输出的答案却翻转成错误。我们将其称为不忠实屈服(unfaithful capitulation,UC),并用一个2×2的潜在层-行为层框架将其分离出来——翻转率指标与单轮忠实性探针都无法捕捉这一现象。在三个数据集(MT-Consistency、MMLU-Pro、GSM8K)上,行为翻转发生时的潜在层正确率在think模式下聚集在50%附近,而在no_think模式下骤降至11-15%——这是模型内成对的因果证据,说明推理正是造成这一差距的原因。跨模型来看,该效应跟随推理通道而变化(在Qwen3-32B和GPT-OSS-20B上高,在内联CoT的Gemma-4-31B-it上低)。一个独立的GPT-4o评判者印证了86%的UC标签;token级探针显示84%的UC样本中答案槽位的argmax是正确的;而一种朴素的轨迹锚定防御则适得其反。我们发布全部对话轨迹、思维链痕迹和评判标签。
