论文

工程规范,测量不稳:共享端点上黑箱大语言模型观察器的预注册可靠性失败研究

Clean Engineering, Unstable Measurement: A Preregistered Reliability Failure of Black-Box LLM Observers on Shared Endpoints

模型评测评测方法与指标

摘要

语言模型评委现在负责控制训练数据、评分生成并推动排行榜。法官是一个测量仪器,基于一个很少提及的假设:相同的请求,发送到相同的型号名称,明天读取相同的结果。我们在两个预先注册的活动中审核了这一假设,每个阈值都是预先确定的;两者都没有通过验证其工具。在 52,988 次经审计的请求尝试中,同一窗口重复排名在 Spearman 0.400 上与要求的 0.90 一致,字节相同的次日重播在 0.78 上与要求的 0.99 上一致,每次执行记录都处于上限。三种机制解释了这种差距:标签到含义的映射,使读数产生与信号一样强烈的偏差;候选者比仪器本身的本底噪声低七个数量级;和字节相同的输入返回不同的排名,这是精确排列读数复合的噪声。度量替换和采样都无法在测试网格上修复它。预先登记的后续行动解决了这个问题:等待对采样的日子没有帮助(0.805 与 0.800,在另外五天内重复);切换提供商没有帮助(四个提供商共享席位,中位数为 0.74 到 0.88,根据他们公开的任何元数据字段进行预测);批处理不变内核上的自托管仅在服务器安静时才有帮助;对于具有已知间隙的构造错误,读数的分隔会跟踪错误类型,而不是大小。我们将证据提炼成三级快照身份阶梯、八项设计规则和报告清单;大约占研究呼叫量 2% 的试点将提前暴露两个无法到达的大门。所有结果都涉及共享服务基础设施上的外部测量行为。在共享端点上,型号名称不是冻结仪器;预先注册的评估必须在冻结其上的任何门之前测量其仪器。