论文
扰动如何传播:大语言模型 稳健性的多层次分析
How Perturbations Propagate: A Multi-Level Analysis of Robustness in Large Language Models
摘要
语言模型会遇到拼写错误、文本损坏、单词更改和标记顺序打乱的情况,但鲁棒性通常仅通过输出行为来评估。我们研究了六种自然和合成输入扰动如何通过仅解码器的语言模型在三个层面上传播:输出行为、隐藏状态几何和注意头函数。我们通过使用居中内核对齐和内在维度分析分层几何来评估四个 GPT-2 和两个 Qwen2.5 检查点的行为影响,并检查 GPT-2 中的注意力头反应。扰动类型产生可区分的度量配置文件,这些配置文件并未被输出测量完全捕获,并且在测试的检查点之间仅部分一致。复制分数与词元替换和洗牌下的激活修补恢复尤其相关。与 GPT-2 中速率匹配的随机词元替换相比,梯度引导的 HotFlip 扰动还会导致更强的行为和表征破坏;他们的行为影响在所有六个测试检查点中都是一致的。我们的结果表明,基于单一行为或表征指标的鲁棒性声明可能会产生误导,并激发对扰动如何改变语言模型计算的多层次评估。