论文
使用廉价辅助信号的语言模型的条件评估
Conditional Evaluation of Language Models with Cheap Auxiliary Signals
摘要
总体准确性隐藏了模型成功和失败的地方。仅根据人工标准标签估计条件性能概况的成本很高,而可以为每个基准项目收集廉价的辅助信号,例如 LLM 判断分数、成对比较、置信度分数和判断不一致特征,但通常有偏差或校准错误。我们提出了 LACE(局部增强控制变量评估),这是一种用于条件 LLM 评估的半监督估计器。关键步骤是局部居中:减去目标轮廓区域内廉价信号的条件均值后,任何线性增强的条件均值为零,因此不能改变估计值。增强系数仅用于提高效率,并且局部岭控制变量将来自标记子集的金标签残差均值与来自完整项目池的廉价信号均值相结合。我们证明了免校准识别、分组轮廓的无偏性、中心线性增强内的局部预言最优性以及对估计系数的一阶自适应性。由此产生的增益公式由总体局部 $R^2$ 控制,它描述了从廉价信号获得的效率如何随着配置文件值的变化而变化。我们还得出了直接配对模型差距和部署加权分数的相应估计量。我们在 MATH-500、ScienceQA、MMLU、WinoGrande、HellaSwag、TruthfulQA、GSM8K 和 ARC 上对主要性能概况估计器进行了实证评估。