论文
混合专家模块包含强幻觉检测信号
Mixture-of-Expert Blocks Contain Strong Hallucination Detection Signals
摘要
尽管被广泛使用,大语言模型(LLM)仍受一个根本问题限制:生成貌似合理却虚假的内容,即幻觉。现有大多数检测方法在答案或句子层面运作,但逐 token 检测对定位幻觉片段并实现细粒度干预至关重要。本文探索使用混合专家(MoE)范式来弥补这一缺口。在 MoE 架构中,单次前向传播经路由机制激活稀疏的专家子集(即每层不同的前馈网络),产生稠密架构中不存在的内部信号(如路由器熵、专家分歧与专家使用模式),这些信号此前未被用于幻觉检测。为此,我们提出 InnerExpert,首个利用这些 MoE 特有信号进行逐 token 幻觉检测的方法。InnerExpert 将路由层信号与标准 transformer 信号组合成紧凑的逐 token 特征向量,交由轻量检测器分类;该检测器用 LLM-as-a-judge 流水线产生的标注训练,从而支持无需人工标注的持续模型更新。结果显示,InnerExpert 在五个数据集与两个 MoE 架构上优于现有方法,答案级与 token 级 AUROC 最高分别达到 0.91 与 0.76,且仅需一次前向传播。