论文
头寸偏差隐藏在上限效应背后:LLM 基准的排列诊断
Position Bias is Hidden Behind Ceiling Effects: A Permutation Diagnostic for LLM Benchmarks
摘要
多项选择 LLM 评估中的位置偏差被广泛认为是能力比较中的一个混杂因素,但已发表的测量结果依赖于单一答案顺序洗牌,其结果将偏差信号与内容级噪声和采样随机性混淆。我介绍了inspect_permute,它是inspect_ai 评估框架的开源扩展,它对每个问题运行详尽的答案顺序排列,并报告带有引导置信区间的位置偏差的卡方/Cramer V 签名。我在四个供应商(gpt-4o-mini、claude-haiku-4-5、gemini-2.5-flash、grok-3)上应用了该工具,对五个 MMLU 主题、温度 0 生成下的 24,000 个 API 调用进行了验证,并在观察到一半数据之前通过公共 SHA-256 哈希值预先注册了伪造者预测。事实证明,位置偏差仅在大约 60-95% 的基本精度金发姑娘区域内才能在统计上检测到。在它之下,处理负载的主导地位淹没了特定主题的信号;在其之上,上限效应将方差压缩到卡方检验分辨率以下。可检测单元分为两种机制类型:单调 A-D 减少(处理负载,在低层模型中)和非单调 D-drop(内容模糊性,在窄能力带中)。标准 MMLU 将每个前沿模型置于检测带之上,因此那里没有信号应被解读为不可测量,而不是无偏。与 arXiv:2606.26185 中的天花板效应表征一起,这项工作将位置偏差测量的可检测区域括起来,并使领域中心问题以可验证的形式提出。包、数据、在 MIT 下的预注册。