论文

确信错误:从 LLM 内部状态检测财务问答中的幻觉

Confidently Wrong: Detecting Hallucinations in Financial Question Answering from LLM Internal States

模型评测模型行为与机制分析

摘要

金融应用中的 大语言模型 (LLM) 在确信错误时会导致最严重的失败。对冲的、不确定的答案会引起审查,而自信的错误会在没有警告的情况下默默地降低下游决策的质量。我们询问如何可靠地从模型的内部激活中检测到这种自信的错误答案或自信的幻觉,以及这些激活是否携带超出其可观察输出的信息。我们在残差流上训练线性探针,并根据真实文件 FinQA 和 TAT-QA 构建的两个已建立的问答 (QA) 基准对其进行评估。行为置信度是根据同一问题的八个重新采样答案之间的一致性来衡量的,并将探测有效性与基线进行比较,例如词元对数概率和模型自己对其答案的真/假自我评估。我们的研究结果表明,在所有八次重新抽样都一致的置信答案中,15-23% 在 FinQA 上是错误的。与基线方法相比,探针在检测幻觉方面具有显着优势,Qwen3-8B、Llama-3.1-8B 和 Gemma-2-9B 的 AUROC 保持在 0.68-0.77,而最佳基线降至 0.55-0.63。我们的结果表明,探测可以成为一种经济有效的分类机制,用于将 LLM 答案路由到高风险金融应用程序中的人工审核和质量控制程序。