论文

结构化扰动下语言模型的稳定性与失败行为度量

Measuring Stability and Failure Behavior in Language Models Under Structured Perturbations

模型评测评测方法与指标

摘要

语言模型通常以单一准确率分数被评判,这无法揭示其性能如何随输入被扰动而退化。我们提出一个分级的、多族群的、失败感知的推理模型压力测试框架。它沿多级严重度阶梯对每个问题进行七个族群的扰动:六个保持答案不变的族——改写、输入噪声、格式、无关上下文、上下文负载和冲突指令——以及一个知识边界族,它移除可答性,使拒答成为正确响应。每个测试都经过有效性门控并按其测量严重度标注,每个模型以逐级准确率、幅度加权稳定性和相对模型自身基线定义的各族崩溃点来概括。在与GSM-Symbolic相同的100个种子问题(扩展为4,473个门控测试)上、在跨能力档位的四个模型上运行,该框架暴露出聚合分数掩盖的结构:模型失败的级别是族群特定的而非全局的,且两个压力源暴露了所有模型的一致弱点:冲突指令和建立在不可能前提上的问题。对不可答性的识别总体上不均衡:对缺失信息和伪造证据可靠,但对不可能前提薄弱。这些失败点在标准准确率报告中不可见。

结构化扰动下语言模型的稳定性与失败行为度量:论文配图
图1:按实测严重度级别(L0 = 未扰动基线)汇总的各模型准确率。