论文
通过软目标注意力探测在 大语言模型 中进行预生成幻觉检测
Pre-Generation Hallucination Detection in Large Language Models via Soft-Target Attention Probing
摘要
在生成之前检测幻觉风险可以实现放弃、检索增强和路由决策,而不会产生解码成本。虽然之前的工作表明可以根据模型的内部表示来估计此类风险,但现有方法将其视为单个解码输出的二进制分类。相反,我们将其表述为风险估计问题。在这个公式下,我们引入了基于随机采样输出的经验答案错误率的软目标监督——我们证明该估计器是模型在其采样分布下的每个提示错误概率的唯一无偏最小方差估计器。我们进一步使注意力探测适应预生成设置,使检测器能够选择性地聚合与幻觉相关的提示表示。在三个问答基准和五个模型中,注意力探索在简答任务上的表现优于线性探索。用软目标监督取代二进制标签进一步持续提高检测质量。