论文
泛化是稳定性,而不是准确性:大语言模型的多轴评估
Generalization Is Stability, Not Accuracy: Multi-Axis Evaluation of LLMs
摘要
大语言模型(LLM)中的泛化是指当相同的输入以不同的方式表达时产生一致且语义稳定的输出的能力。现有的工作通常通过单个提示格式、任务或一组变体的聚合准确性来评估泛化能力,这将鲁棒性与整体基准性能混为一谈。在这项工作中,我们在单个示例的层面上、跨多个输入变体以及跨模型行为的不同方面展示了泛化评估,重点关注可变性,而不是将性能降低到可以通过狭隘训练或其他混淆泛化评估的方式来提高的分数。根据这一观点,我们引入了稳定性感知泛化目标(SAGO),这是一个框架,用于测量相同输入在不同变化和基准下的模型行为变化程度,捕获跨多个维度的变化,包括生成一致性、内部激活、置信度和响应镜像。我们表明,许多常用模型表现出统计上显着且一致的泛化不稳定性:没有模型能够统一泛化,行为轴捕获独立的故障模式,跨数据集变化可以逆转模型排名。