论文
分解引起的上下文记忆冲突:当事实检查管道与其自己的源文本相矛盾时
Decomposition-Induced Context-Memory Conflict: When Fact-Checking Pipelines Contradict Their Own Source Text
摘要
分解然后验证管道,包括 FActScore 式的事实检查器和长格式事实评估器,首先将一段段落分割成原子声明,然后再检查每个声明。分解本身被视为中性预处理步骤。我们证明事实并非如此:分解者可以被诱导用自己的参数信念替换源段落所说的内容,产生与它应该忠实总结的文本相矛盾的主张。我们将这种分解引起的上下文记忆冲突(DI-CC)称为分解引起的上下文记忆冲突(DI-CC),并表明它在机制上与经典上下文记忆冲突是相同的现象,发生在与先前工作所研究的不同的管道阶段内。仅在经典上下文记忆冲突数据 (NQ-Swap) 上训练的线性探针,从未暴露于任何分解输出,可将产生 DI-CC 的分解位置与忠实分解显着分离(AUC = 0.86-0.88,排列 p < 0.0005)。现有的无参考基线、SelfCheckGPT 式的自一致性采样根本无法检测 DI-CC(AUC 0.51,机会水平),因为 DI-CC 内容可以稳定地恢复并在重新采样中重复出现,这与自一致性方法所依赖的变异性不同。上下文感知解码是经典设置的 无需训练 缓解措施,转移到分解并抑制 DI-CC,但代价高昂:在重共指条件下的许多分解无法解析,通常是因为分解器制造了不同的身份。我们认为这种缓解措施尚未准备好部署。我们进一步描述了该机制的边界:它的自然发生率太稀疏,无法在自然发生的幻觉文本上体现出来,并且需要最小的模型规模来将 DI-CC 检测为真实的、有机械基础的、部分可处理的故障模式,其范围我们可能夸大了。