论文
大推理模型在多轮攻击下的一致性
Consistency of Large Reasoning Models Under Multi-Turn Attacks
摘要
具备推理能力的大型推理模型在复杂任务上取得最先进性能,但其在多轮对抗压力下的鲁棒性仍研究不足。我们在对抗攻击下评估了九个前沿推理模型。我们发现,推理带来有意义但不完全的鲁棒性:所研究的大多数推理模型显著优于指令微调基线,但所有模型都表现出各自不同的脆弱性特征,其中误导性建议普遍有效,而社会压力的效果则因模型而异。通过轨迹分析,我们识别出五种失败模式(自我怀疑 Self-Doubt、社会顺从 Social Conformity、建议劫持 Suggestion Hijacking、情绪易感 Emotional Susceptibility、推理疲劳 Reasoning Fatigue),前两种占失败总数的 50%。我们进一步证明,对标准 LLM 有效的置信度感知响应生成(Confidence-Aware Response Generation,CARG)在推理模型上失效,原因是冗长的推理轨迹诱发过度自信;与直觉相反,随机置信度嵌入优于针对性提取。我们的结果强调,推理能力并不会自动带来对抗鲁棒性,且基于置信度的防御需要针对推理模型进行根本性重新设计。