论文

InsufficiencyBench:评估LLM对欠规格用户查询的法律建议

InsufficiencyBench: Evaluating LLM legal advice on underspecified user queries

模型评测基准与评测资源

摘要

法律 AI 系统越来越多地被用于回答法律问题,但现有基准都假设查询是完整规格化的。实践中,用户会省略对法律结果有实质影响的事实。我们引入 InsufficiencyBench,首个针对查询侧信息不足的法律基准:模型是否能识别查询缺乏法律上重要的信息、指出缺失内容,并避免过早下结论。我们形式化了三个结构失败模式——切换(switch)、门控(gating)与致命前提(fatal prerequisite)——下的八类典型缺失要素分类,构建了 202 个基准条目(58 个基础查询、144 个缺陷变体),覆盖六个法律领域和 24 个美国司法辖区,并由执业律师标注。对十个前沿模型的评估发现,没有一个模型在缺失要素识别上超过 F2 = 0.46,召回率中位数为 0.44。模型要么不加区分地含糊其辞,要么在虚构的假设下默默作答。没有任何模型既能识别缺陷查询并对其回答附加限定,又能直接回应完整查询。

InsufficiencyBench:评估LLM对欠规格用户查询的法律建议:论文配图
图4:十个模型在各类别上对缺失元素的召回率。行为模型,按总体F2自上而下排序;列为八种规范的不充分类别(见表1)。Proc.(程序性姿态)被所有模型灾难性地漏检(平均召回率=0.09),而Ctrl.Txt(控制性文本,如法定条款或合同条文)的召回率最高(平均=0.64)。