论文
不是你想的那个意思:LLM能否遵循指定的否定语义?
Not What You Meant: Can LLMs Follow a Specified Negation Semantics?
摘要
否定在不同领域并无统一的解释。在法律、监管与医学推理中,所采用的解释取决于当下生效的读法——开放世界对封闭世界、二值对三值、以及轻信对怀疑。我们研究大语言模型默认采取哪种否定读法,以及当明确指定不同读法时它们能否覆盖该偏好。为此,我们提出NAFBench,一个生成求解器认证实例的程序化生成器,覆盖四种语义观点:SLDNF、良基语义(WFS),以及稳定模型语义下的轻信推理与怀疑推理。该生成器输出具有受控深度、宽度与环结构的基态正规逻辑程序。每个程序在四种观点下分别用SWI-Prolog、良基语义求解器和clingo求解,最多产生四个分歧标签。随后,程序在保持答案不变的多种表述方式与规则排序下被转化为自然语言。结果揭示了一个一致的差距。在开源模型中,遵循指定的否定语义仍未解决:最强模型在四种语义观点上的得分为59-74%,最弱为31-67%。所有模型在超过一半的逻辑等价规则重排上表现出顺序敏感性,而两个较弱的模型经常在良基'未定义'上过度承诺。两个前沿模型在主固定复杂度评测集上达到100%,第三个o4-mini接近完美,仅在良基'未定义'上降至81%。将推理委托给求解器、在认证轨迹上微调或强制输出显式三值判定,每一种都部分缩小了差距。