论文

谁漂移了:系统还是裁判?LLM评估中的任意时点有效归因

Who Drifted: the System or the Judge? Anytime-Valid Attribution in LLM Evaluation Pipelines

模型评测评测方法与指标

摘要

对大语言模型产品的持续评估依赖于一个被视为基本事实的强有力的大语言模型法官:廉价的监视器对每次互动进行评分,当分数下降时,团队就会被传呼。但法官本身就是 API 背后的一个模型,无声版本更新或评分提示更新会改变它的评分方式——因此,每个漂移警报在更差的产品和改变的法官之间都是模糊的。我们通过固定的、人类标记的锚集来解决模糊性,当前法官以稳定的交错重新评分,对法官与人类差距进行第二个投注电子过程,以及返回{none,system,judge}判决的保护窗口规则。我们证明了任何时间的有效性、单向识别(只有法官可以移动锚点),这是一种归因竞赛,其设计法则是锚点必须超过它们所守护的主要过程,并且过程正交。在两次真实的判断更改中,在 60/60 次运行中,无声版本碰撞被检测为判断漂移,判断对系统的误归因为零,并且在保护宽度 300 的 120 次运行中,有 110 次正确地归因了污染的严格提示更改,而行业默认的滚动 z 测试在 75% 的无漂移流上出现误报。每个实验都会在第二个域(TL;DR 总结)上进行复制,而无需重新调整,并且域不同的地方的差异就是种族预测的差异:严格提示的更改会在那里得分更高,因此锚点触发更快,归因变得完美(240/240)。该显示器的运行成本约为对每个项目进行强判断的 0.64 成本,或者在更便宜但更聋的制度中为 0.21。

谁漂移了:系统还是裁判?LLM评估中的任意时点有效归因:论文配图
图 3:HelpSteer2(左)和 TL;DR(右)上的共同配置边界(真正的严酷漂移,k=200k{=}200,W=50W{=}50、30 个种子)。判断延迟仅取决于锚定速率,系统功率仅取决于主配置(命题4);错误归因溢出沿主功率轴以固定锚定率增长,因此可行区域是对角线带——主功率和锚定率必须同时提高。 TL;DR 较大的严酷偏移使频带向较慢的锚定速率移动:相同的几何形状,由漂移幅度设置。