论文

当缺席是证据时:评估 大语言模型 中完整性敏感的否定推理

When Absence Is Evidence: Evaluating Completeness-Sensitive Negative Reasoning in Large Language Models

模型评测基准与评测资源

摘要

大语言模型 (LLM) 经常被询问记录、列表或检索的上下文中是否缺少某些内容。然而,只有当证据完全覆盖查询范围时,非观察才允许给出否定答案;否则,答案应该仍然未知。我们称之为完整性敏感的消极推理。我们引入了 CROWN-QA,其中包括 CROWN-Synth(一个受控配对核心,可修复问题和观察到的事实,同时仅改变查询相对覆盖范围)和 CROWN-Real(具有受控覆盖范围变体的真实文档对比集评估)。在三个 LLM 系列中,模型表现出不稳定的闭合判断和严重的过度闭合,无法可靠地区分合理的否定答案(已证明否定)和证据不足(未知)。 CROWN-Synth 的主要失败是不对称的:模型通常识别隐式完整证据,但将隐式部分证据视为查询覆盖。提示会重新分配过度闭合和闭合不足之间的错误,而不是始终如一地解决它们。结构化证书引出将许多错误追溯到证据覆盖错误描述。 CROWN-Real 表明,核心部分覆盖不对称性在真实文档内容上仍然存在,而其强度以及过度封闭和封闭不足之间的平衡因模型、提示和来源而异。