论文

HIVE:扩散中幻觉检测的隐藏证据验证 大语言模型

HIVE: Hidden-Evidence Verification for Hallucination Detection in Diffusion Large Language Models

模型推理推理验证与自校正

摘要

Diffusion 大语言模型 通过迭代去噪生成文本,暴露可能包含最终输出之外的可靠性信号的隐藏轨迹。我们提出 HIVE,它压缩轨迹隐藏状态,选择信息丰富的阶梯层证据,并通过连续的前缀嵌入来调节验证器以产生幻觉分数和结构化诊断。在两个 D-LLM 和三个 QA 基准测试中,HIVE 在所有六种设置中均优于八个既定基线和验证者主干匹配的纯文本控制。相对于纯文本验证,隐藏证据调节将 AUROC 提高了 1.73--4.60 点,将 AUPRC 提高了 1.10--3.62 点,平均增益分别为 3.15 和 2.28 点。消融、证据干预和跨数据集传输进一步支持细粒度隐藏轨迹证据的补充价值。