论文

FailureScope:语言模型弱点的跨机制行为诊断

FailureScope: Cross-Regime Behavioral Diagnosis of Language Model Weaknesses

模型评测评测方法与指标

摘要

标准基准报告总体准确性,但从业者需要知道模型缺乏哪些特定功能。我们引入了 FailureScope,一种行为诊断方法,通过跨模型通过/失败模式(留一模型,LOMO)对评估探针进行聚类,并表明它可以在通常单独研究的三种机制中产生稳定的、可解释的失败分类法:单轮基准、多轮对话和对抗代理攻击。在 18 个模型的 2,664 个单轮任务中,分类条件采样在 50 个任务中达到 Kendall tau = 0.81(随机选择为 0.34),跨模型故障预测达到 AUC 0.88。相同的原语在 363 个任务多回合语料库和 630 个对抗代理跟踪上恢复可解释集群,其中暴露了元故障模式:LLM 判断 ASR 与实际执行之间存在 73-100 个百分点的差距。在所有三种机制中,聚类凝聚力仍然很强,我们将其视为行为聚类是一种便携式诊断原语的证据,其泛化能力超出了任何单一基准。我们发布了管道、三个带注释的语料库和跨区域分类法。