限制一个模型,向下一个模型开放:法律多项选择基准中的纯选项可解决性
Gated Against One Model, Open to the Next: Option-Only Solvability in Legal Multiple-Choice Benchmarks
摘要
多项选择基准的评分标准是模型是否选择了正确的选项,而不是模型是否需要该问题。衡量这种差距需要小心:无论密钥位于 A 处,对大多数项目回答 A 的模型得分都高于机会,而当密钥不在 A 处时,则将其视为识别。我们在 UA-JudgeExam 上进行了测量:11,990 个带有官方密钥的四选项项目,由乌克兰法官高级资格委员会发布。显示选项且没有问题,Claude Haiku 4.5 的随机得分为 0.383,并且泄漏集中:11.8% 的项目在所有八个选项订单上都是盲答的,而随机预期的项目为 0.2。这不是引文:搜索乌克兰立法的 280,059 个版本,得到 0.128。将这些项目排除掉后,保留了 8,128 个项目,门控模型本身现在在这些项目上的得分为 0.204,而没有参与选择的 GPT-5.6 仍然回答了其中的 0.515 个项目,并隐藏了问题。对整个集合中 12 个保留的模型进行评分,并减去每个人的答案位置习惯,只有两个保持超额:GPT-5.6 为 +0.265,Sonnet 4.6 为 +0.081。如果没有它,排名会产生误导:Llama 3.1 8B 盲测得分为 0.292,高于除这两个之外的所有模型,仅对 92% 的项目回答 A。门确实选择了一些真实的东西:在它拒绝的项目上,十二个模型中有十一个得分为 0.518-0.789,每个区间都清楚同一模型在它保留的项目上的得分。但该信号是一个模型的信号,对其进行滤波不会向上传输。这两种情况在 400 个项目的样本中都不可见,其中有 9 个模型被解读为“统计上偶然”。相反,重写干扰项会超调至 0.168,低于概率且可利用。 LEXam 上的相同探测会返回机会:每个选项都指向词干,长度不超过 33 个字符。项目格式决定了问题是否会出现;能力决定提取多少。我们发布语料库、预测和工具。