论文

相同的分数,不同的决定:评估 JEV 和法律文档理解的语言模型

Same Scores, Different Decisions: Evaluating JEV and Language Models for Legal Document Understanding

模型评测鲁棒性、公平性与可信度评测

摘要

契约推理需要对共享文档进行多次判断,但总体准确性可以掩盖各个决策的变化。重复一致也是不够的:模型可能始终返回错误的答案。在本文中,我们将 Jev 与 ContractNLI 上的九种语言模型进行比较,评估推理成本、响应时间、平均正确性以及重复请求条件下的正确性。受控比较改变假设可见性、要求的输出和输出顺序,同时保持契约和目标判断固定。在评估的配置中,Jev 的成本和中值响应时间最低,而托管语言模型则实现了更高的基线准确性。按基线准确度进行的排名与按每个条件和重复的正确性进行的排名不同,尽管后者的微小差异并不能建立总体稳定性优势。开发诊断进一步揭示补偿性修正和回归,以及持续性错误。这些发现促使我们评估成本和响应时间,以及随着请求配置的变化个人判断是否仍然正确。代码:这个https URL