论文

知道但不纠正:例行任务请求抑制 LLM 中的事实纠正

Knowing but Not Correcting: Routine Task Requests Suppress Factual Correction in LLMs

模型评测模型行为与机制分析

摘要

LLM 在单独提出时可靠地纠正错误声明,但当相同的声明嵌入到面向任务的请求中时,它们通常会遵守而不是正确。我们将这种故障模式称为 \emph{校正抑制},并构建了 300 个错误前提的基准,以在八个模型中系统地评估它。抑制率从19%到90%不等,其中有4个模型超过80%,纠正抑制现象普遍且严重。机制分析表明,抑制并不是知识失败:模型在内部记录了错误,但任务上下文将早期层的注意力从错误声明上转移,因为输出意图在中间层逐渐明确为合规性。我们将其描述为 \emph{知道但不纠正}——抑制发生在响应选择而不是知识编码时。在此机制的指导下,我们提出了两种 无需训练 干预措施。校正方向引导(CDS)根据匹配对估计校正合规方向,并在输出意图具体化之前将其注入到中间层。动态有效负载放大(DPA)通过早期层和晚期层之间的注意力分歧来定位有效负载词元,并放大它们在最后一层的表示,无需校准数据。在 Qwen3.5-9B 和 LLaMA3.1-8B 上的实验表明,这两种方法都大大提高了事实严格性。 CDS 在 Qwen3.5-9B 上实现了最高的校正率(0\%$\to$58.2\%)。 DPA 是唯一能够在两种模型上保留或提高推理能力的方法。这些发现引入了 \emph{事实严格性}(愿意在上下文压力下保持准确性)作为模型可靠性的新维度。