论文
当残差化有助于审计时:格式效应、切片增益及其限制
When Residualization Helps an Audit: Format Effects, Slice Gains, and Their Limits
摘要
围绕大语言模型系统使用的评估分数——包括奖励模型、重新排名和大语言模型评委——可以跟踪表面形式,而不是他们声称要衡量的质量。当针对同一 MBPP 问题提供简洁的正确解决方案和带评论的错误解决方案时,公共偏好奖励模型选择正确的解决方案并不比抛硬币好(0.507)。从这些分数中减去可预测的表面成分越来越普遍,但单独去除并不能产生更有效的测量:去除的成分可能携带与构造相关的信号,并且残差无法区分哪个是哪个。在设计的干预措施下(仅进行注释编辑的单元测试标签),残差将奖励模型的格式效应对正确和有错误的代码减弱了约 0.12,而正确与有错误的边距变化不到 0.01。在观察性 NLI 和 QA 设置中,我们在评分之前冻结保留的复制,并使用来自不相交注释器的标签重新评估它;这仅支持一个较窄的结论:与预先声明的切片上的构造标签更好地一致,其中仅表面预测器出错,而不是修复的分数。在每个具有报告的正切片增益的观察环境中,总体一致性都会下降,并且在每个此类 QA 设置中,问题内排名都会下降。当构造和表面特征纠缠在一起时,残差可以在降低构造对齐的同时使分数去相关,并且在受控模型中,配置就像破坏构造对齐一样通过每个预调整检查,因此没有承诺的门是保证。我们将这些区别汇总到一个报告协议中,其结果(包括拒绝)说明了调整后的分数可能声称要显示的内容:在其产生的构造对齐成本旁边报告审计时诊断,而不是原始分数的替代品。