论文

Grad Detect:LLM 中基于梯度的幻觉检测

Grad Detect: Gradient-Based Hallucination Detection in LLMs

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 在不同的任务中表现出了卓越的能力,但它们仍然容易产生幻觉。检测这些幻觉对于在高风险应用中可靠地部署 LLM 至关重要。我们提出了 Grad Detect,这是一种基于梯度的方法,通过分析推理过程中单个前向-后向传递的分层梯度模式来预测幻觉。我们的方法表明,模型的内部梯度结构携带了有关其输出正确性的丰富信息。仅通过输出级信号无法访问此信息。我们在幻觉检测和模型弃权预测的多个问答基准上评估了 Grad Detect,它始终优于基于置信度和基于采样的基线。通过对四个架构系列的所有 11 个模型进行全面的层消融研究,我们发现最后五层集中了 97% 以上的判别梯度信号,从而能够以最小的性能损失实现高效部署。 Grad Detect 提供了一个统一的框架,用于预测 LLM 可靠性的多个维度,提供强大的预测性能以及对模型故障的来源和方式的可解释的见解。