论文

优先选择覆盖:LLM 法官未充分使用其合同授权的非定向判决

Cherry-pick Override: LLM Judges Under-use the Non-Directional Verdicts Their Contract Authorizes

模型评测评测方法与指标

摘要

循证事实核查越来越多地使用 LLM 法官将证据转化为最终判决。许多任务合同故意包含非定向判决——对于实质性混合的证据存在冲突,对于缺乏证据则没有足够的证据——这样系统就可以拒绝断言某个方向。对授权裁决为非定向的主张返回支持或反驳是定向过度承诺:其输出是合约未授权的方向的标签错误。它的冲突实例——两条链都存在,其中一条返回——是 Cherry-pick Override (CPO);与不足的实例不同,它不能通过检索更多来修复,因为没有丢失任何东西。在 AVeriTeC 的黄金冲突子集 (N_C=150) 上,四个选项类型的专家组定向承诺 18.7% 的索赔,四名冷冻当代法官(两名专有,两名开放权重)承诺 21.3-48.0%,24.0-38.0% 致力于维生素C-混合,这是一种构建的压力测试,排名相反。这些是保守的下限:共享提示详细指定冲突,禁止折叠到一个方向,并演示标签 3 次。这种失败并非特定于冲突:每位法官对黄金的过度承诺——不足的案件的处理率相当,并且在维生素C混合案件中,四分之三的案件超过了CPO。在新的背景下被问及时,两位法官指出了他们自己的 CPO 索赔中大约三分之二的冲突,而他们在 0.12 下正确地做出了承诺:认可是可用的,并且没有到达最终行动。打字词汇、小组投票、置信度阈值、结构验证器和自我分解都留下了大量的残差,最后通过将片面的证据重新标记为冲突来购买部分残差。每个费率都是由数据集定义的;我们报告没有人类确认的患病率。