论文

用于大语言模型幻觉检测的预测编码与信息瓶颈

Predictive Coding and Information Bottleneck for Hallucination Detection in Large Language Models

模型推理推理验证与自校正

摘要

大语言模型(LLM)中的幻觉——看似合理但事实上不忠实的生成——仍是高风险部署的关键障碍。当前检测方法通常依赖计算昂贵的外部检索循环,或需要 70B+ 参数的不透明黑盒 LLM 裁判。在本工作中,我们介绍 [Model Name],一个结合神经科学启发信号设计与监督机器学习的混合检测框架。我们提取基于预测编码(量化对内部先验的惊讶度)与信息瓶颈(测量扰动下信号保留)的可解释信号。通过系统消融,我们展示三项关键增强:实体聚焦摄取(集中于高价值词元)、上下文依从(测量接地强度)与可证伪性分数(检测自信但矛盾的声明)。在 HaluBench(n=200,完全平衡)上评估,我们的理论引导基线达到 0.8017 AUROC。BASE 监督模型达到 0.8274 AUROC,而 IMPROVED 特征把性能提升至 0.8669 AUROC(4.95% 增益),并跨架构保持一致改进。这一有竞争力的性能是在比 Lynx 少 75 倍训练数据(200 对 15,000 样本)、推理快 1000 倍(5ms 对 5s)且完全可解释的情况下取得的。关键的是,我们报告一个负面结果:合理化信号无法区分幻觉,提示 LLM 会为错误前提生成连贯推理(谄媚)。本工作表明,编码在信号架构中的领域知识相较扩展 LLM 裁判提供更优的数据效率,以轻量(不到 1M 参数)、可解释的模型取得强劲性能,适合生产部署。