论文
InsufficiencyBench:评估LLM对欠规格用户查询的法律建议
InsufficiencyBench: Evaluating LLM legal advice on underspecified user queries
摘要
法律 AI 系统越来越多地被用于回答法律问题,但现有基准都假设查询是完整规格化的。实践中,用户会省略对法律结果有实质影响的事实。我们引入 InsufficiencyBench,首个针对查询侧信息不足的法律基准:模型是否能识别查询缺乏法律上重要的信息、指出缺失内容,并避免过早下结论。我们形式化了三个结构失败模式——切换(switch)、门控(gating)与致命前提(fatal prerequisite)——下的八类典型缺失要素分类,构建了 202 个基准条目(58 个基础查询、144 个缺陷变体),覆盖六个法律领域和 24 个美国司法辖区,并由执业律师标注。对十个前沿模型的评估发现,没有一个模型在缺失要素识别上超过 F2 = 0.46,召回率中位数为 0.44。模型要么不加区分地含糊其辞,要么在虚构的假设下默默作答。没有任何模型既能识别缺陷查询并对其回答附加限定,又能直接回应完整查询。
