论文

当准确性差距无法证明时:审计大语言模型法官的跨域重新校准

When Accuracy Gaps Fail to Certify: Auditing Cross-Domain Recalibration of LLM Judges

模型评测鲁棒性、公平性与可信度评测

摘要

当任务分布发生变化时,适合一项任务的 LLM 法官的标量重新校准图可能会失败,但源-目标准确度差距通常被视为该失败的代理。我们测试了这个差距可以预测什么以及它可以在 13 位法官、两个生成器、8 个域和 1,176 个预先声明的传输中证明什么。考虑到平均分数变化后,差距产生了目标校准误差的总体下限,但相同的差距可能会导致相反的转移结果。精确的重要性加权恢复了协变量偏移下的目标适当损失,因此估计的加权管道的失败本身不会建立条件偏移。有限样本同时较低的证书使用与评估结果脱节的审核标签将总体限制转换为单方面拒绝规则。无泄漏间隙相关性为 0.25 (95% CI [-0.09, 0.55]),在第二个生成器上降至 0.09,并且不支持生成器不变关联。该证书保留了标称覆盖范围,但即使在 m=1024 时,功效也为 0.13,而具有 16 个标签的目标域温度缩放达到危害率 0.09,而源拟合 Platt 缩放的危害率为 0.34。因此,精度差距是标量概率传递的微弱警告信号,而不是部署证书。