论文

作为正交噪声的幻觉:通过动态上下文正交化进行推理时间流形对齐

Hallucinations as Orthogonal Noise: Inference-Time Manifold Alignment via Dynamic Contextual Orthogonalization

模型推理解码与生成控制

摘要

大语言模型 (LLM) 中的幻觉,其特征是生成与上下文事实或逻辑约束不一致的内容,这仍然是可靠部署的持续挑战。在这项工作中,我们通过植根于线性表示假设的几何框架来解决这个问题。我们提出幻觉表现为相对于残余流的语义流形的正交噪声。具体来说,我们假设虽然注意力头理想地传播​​与上下文子空间一致的信息,但当特定头引入与该子空间正交的组件时,就会出现幻觉,从而破坏潜在表示的连贯性。基于这个公式,我们引入了动态上下文正交化(DCO),一种推理时间干预方法。 DCO利用输入残差流作为动态上下文锚来对注意力头输出执行正交分解。为了区分上下文对齐的语义更新和发散的噪声,DCO 采用分层 Z 分数抑制机制,根据统计分布有选择地减弱异常正交分量。通过 XSum、NQ-Swap 和 IFEval 等基准对 Llama-3-8B 和 70B 进行的评估表明,与最先进的干预基线相比,DCO 实现了卓越的上下文 忠实性。此外,DCO 在 TriviaQA 和 TruthfulQA 等知识密集型任务上保持高性能,有效缓解了现有方法中经常观察到的幻觉抑制和参数知识保留之间的权衡。我们的研究结果验证了幻觉的几何解释,并将 DCO 确立为一种执行流形对齐的计算高效方法。我们的代码可在 https://github.com/Harry-Miral/DCO 获取