论文

纠正性提示何时有害:OWL 2 DL下推理器引导修复LLM对蕴含否定过度谨慎的提示设计

When Corrective Hints Hurt: Prompt Design in Reasoner-Guided Repair of LLM Overcaution on Entailed Negations under OWL~2~DL

模型评测上下文与知识本体模型行为与机制分析

摘要

我们报告了GPT-5.4在OWL 2 DL合规性查询上的一种可复现错误模式:当推理器(reasoner)蕴含的答案在\emph{FunctionalProperty}闭包或类\emph{不相交(disjointness)}下为"否"(no)时,模型经常回答"未知"(unknown)。我们使用180条经推理器审计的查询——来自对所观察模式的程序化扩展——外加来自两个不相关领域(保险与临床)的18条手工编写的留出查询,在匹配查询预算下比较四种交互模式:单次问答、三轮通用"你错了"式重试、带开放世界假设(OWA)提示的三轮推理器裁决修复,以及不带该提示的相同修复。直接忠实率为43.9%(Wilson 95% CI [36.8,51.2]);通用重试达到81.7%([75.4,86.6]);带提示的裁决修复反而更差,为67.2%([60.1,73.7]);仅裁决修复达到97.8%([94.4,99.1])。在经Bonferroni校正的McNemar精确检验下,所有两两比较均显著(α=0.01;所有 $p < 10^{-5}$)。同一错误指纹解释了留出查询上4/4的错误。我们的解释是有边界的:提示的框定方式可能比纠正内容更重要,推理器引导的封装应做显式消融。

纠正性提示何时有害:OWL 2 DL下推理器引导修复LLM对蕴含否定过度谨慎的提示设计:论文配图
图 1:开发集上每个类别的忠诚度。上图:单次直接模式——GPT-5.4 的缺陷集中在混合(FunctionalProperty 闭包 + 不相交)和 numeric_builtin 上。下图:经过反例驱动的修复后——GPT-5.4 弥补了大部分差距;残余误差集中在混合类别中。