论文
脆弱推理:LLM 对意义保留扰动敏感性的机制分析
Fragile Reasoning: A Mechanistic Analysis of LLM Sensitivity to Meaning-Preserving Perturbations
摘要
大语言模型 在数学推理基准上表现出强大的性能,但对于保留意义的表面扰动仍然非常脆弱。我们针对 677 个 GSM8K 问题以及通过名称替换和数字格式释义生成的语义等效变体,系统地评估了三个开放权重 LLM、Mistral-7B、Llama-3-8B 和 Qwen2.5-7B。所有三个模型都表现出很高的答案翻转率(28.8%-45.1%),数字释义始终比名称交换更具破坏性。为了追踪这些故障的机械基础,我们引入了机械扰动诊断 (MPD) 框架,将 logits 透镜分析、激活修补、组件消融和级联放大指数 (CAI) 结合到统一的诊断管道中。 CAI 是一种量化逐层发散放大的新颖指标,作为三种架构中的两种的故障预测器,其性能优于第一个发散层(AUC 高达 0.679)。 logits 镜头揭示了翻转样本在比稳定样本早得多的层上偏离了正确的预测。激活修补揭示了故障定位能力上的明显架构分歧:Llama-3 故障可通过在特定层(43/60 个样本)进行修补来恢复,而 Mistral 和 Qwen 故障分布广泛(3/60 和 0/60)。基于这些诊断信号,我们提出了机械故障分类法(局部、分布式和纠缠),并通过有针对性的修复实验对其进行验证:转向向量和 微调 层恢复了 12.2% 的局部故障 (Llama-3),但仅恢复了 7.2% 的纠缠 (Qwen) 和 5.2% 的分布式 (Mistral) 故障。