论文
超越准确率:面向法律依据任务中视觉-语言模型的双裁判评测协议
Beyond Accuracy: A Dual-Judge Evaluation Protocol for Vision-Language Models in Legally Grounded Tasks
摘要
AI系统越来越多地在需要法律问责的场景中被评测,在这些场景中,正确的输出还必须能对照适用的法律标准进行论证。现有的法律AI基准和LLM即裁判协议为衡量任务性能和开放式回复质量提供了重要基础设施。我们贡献一个额外的评测信号:一个双裁判协议,将标准的0-10质量裁判与严格的二元语义等价裁判配对,后者对照人工整理的参考答案。我们研究一个受控的、视觉落地的监管任务——英国交通标志解读,其含义是一个成文问题,每个输入都有已知参考——并不仅测量两个裁判是否分歧(按构造必然分歧),而是测量分歧的程度和位置。在七种可见度水平和两种遮挡模式下的4,680次评测中,两个裁判呈中度相关(点二列r = 0.644),同时揭示出影响8.0%评测的非对称第二类错误模式。其分布颇有启发:边际率在高清可见度时达到峰值(v = 0.8时为14.2%),只是因为高分答案在那里常见;但如果只看已经得到7分以上的答案,重遮挡下的比率最高(v ≤ 0.3时为54-63%),也就是说,输入退化最严重时高分反而最不可信。我们明确指出该信号是该裁判与参考答案组合的属性:一项49行的人工核查显示,0-10裁判与普通读者的判断高度一致(Pearson r = 0.81;与LLM准确率子分数r = 0.80),而等价裁判相当严格,但只是单向地更严格。该协议每次评测只增加一次LLM调用,并给出单裁判协议无法报告的信号。我们发布提示词模板、遮挡变体和完整评测结果。
