论文
评估潜在推理模型的对抗鲁棒性
Assessing Adversarial Robustness of Latent Reasoning Models
摘要
大型语言模型越来越依赖长的思想链(CoT)轨迹来进行复杂的推理,但自回归生成会带来大量的内存和推理成本。潜在推理模型 (LRM) 通过将中间推理压缩为少量连续潜在向量,提供了更有效的替代方案。然而,尽管 LRM 效率很高,但其对抗鲁棒性在很大程度上仍未得到充分探索。在这项工作中,我们系统地评估了跨文本和多模式设置的潜在推理的稳健性,涵盖八个模型和六个基准。我们发现,在我们评估的设置中,LRM 在对抗性扰动下通常不如显式 CoT 基线稳健,在白盒攻击下退化尤其严重。进一步的分析揭示了跨模态的不同故障模式:文本潜在状态表现出脆弱的动态性和对特定输入模式的高敏感性,而多模态模型中的潜在状态可以在很大程度上保持对输入扰动的不变性,并且对最终预测的影响有限。这些发现暴露了当前潜在推理方法的鲁棒性局限性,并强调在设计隐式推理系统时需要共同考虑效率和鲁棒性。我们已经开源了我们的代码,以便于在这个 https URL 上复制我们的研究。