论文

JuryProbe:识别大模型评判的错误共识,并转入证据核验

JuryProbe: An Empirical Consensus-Risk Diagnostic for Routing Reference-Free Factuality Judge Panels to Grounded Verification

模型评测评测方法与指标

摘要

低成本大模型评判小组越来越多地决定直接接受主张还是升级核验。事实判断中,无参考证据的多个模型一致赞同,可能反映共同漏判盲点,而非独立证据。JuryProbe结合校准路由策略,通过标注探针中的假阴性相关性和错误共识放大程度估计风险;高风险时,把多数接受的主张转给同一组模型,但提供可信参考证据。经检查的FEVER扰动样本中,假阴性相关系数为0.402和0.368,错误共识放大3.13倍和18.13倍;在可信证据的理想诊断条件下,两类证据配置的一致错误共识均降至零。34/34个数据划分显示,高风险路由实际等价于对所有多数接受主张追加证据核验,诊断决定是否启用。预先固定的规则在合成、基准编写及科学样本中标出10个划分中的8–10个,在阴性对照中则未标出;不追加核验可节省28%的证据获取,错误接受率增加0.004。弱BM25检索下仍能降低错误接受,但覆盖率代价较高;停止核验的旧标签也需定期重校准。研究没有形式化风险保证,也未证明真实评判小组能可靠停止核验,贡献是识别高风险错误相关性的经验性诊断。