论文
AURORA:大语言模型 中用于鲁棒幻觉检测的不对称和更新引起的旋转
AURORA: Asymmetry and Update-Induced Rotation for Robust Hallucination Detection in Large Language Models
摘要
大语言模型 (LLM) 在广泛的自然语言处理任务中表现出了卓越的能力。然而,它们容易产生幻觉,即事实上不正确或不忠实的输出,这对其在高风险应用中的部署构成了关键障碍。尽管最近的幻觉检测方法取得了令人鼓舞的进展,但它们通常依赖于昂贵的输出级一致性检查或捕获浅层数据集特定模式的静态隐藏状态探测,从而导致跨数据集评估下的大幅退化。在这项工作中,我们提出了 AURORA,一种新颖的幻觉检测框架,它将焦点从静态表示转移到 LLM 的权重梯度动态。我们的主要见解是,幻觉和忠实的答案会导致模型参数的梯度更新模式发生质的不同。具体来说,幻觉样本会触发不对称和结构失准的梯度,这可以通过两个互补的特征来捕获:(1) 权重矩阵及其梯度更新方向之间的余弦相似度分布的偏度,以及 (2) 旋转比率,它量化梯度更新通过 SVD 重新定向权重矩阵的奇异向量基础的程度。 AURORA 在四个模型系列和四个基准数据集上实现了强大的幻觉检测性能。进一步的分析表明,我们的方法可以有效地跨模型大小进行扩展,并转移到域外任务,包括数学推理和视觉语言场景。