论文

当金融微调失效时:领域适应语言模型中数值幻觉的三级可检测性分析

When Financial Fine-tuning Fails: A Three-Level Detectability Analysis of Numerical Hallucination in Domain-Adapted Language Models

模型评测模型行为与机制分析

摘要

金融大语言模型越来越多地用于报告和披露的摘要,其中数字幻觉带来了重大的实际风险。虽然之前的工作经常将这种幻觉归因于数字推理不足,但这一假设尚未在受控微调设置下进行系统测试。在本文中,我们对财务摘要中的数字幻觉进行了一项经济高效的对照研究,涉及三种模型变体:基本指令调整模型、领域语言适应模型 (FT-A) 和数学增强领域模型 (FT-A+B+C)。我们引入了三级可检测性分类法,区分显性幻觉(以货币计价的捏造)、隐性显性幻觉(专业会议数字)和隐性隐性幻觉(无根据的定量主张)。我们的结果表明,域微调大大降低了所有可检测水平的数值限制。虽然基本模型保持接近于零的幻觉率 (5.4\%),但 FT-A 表现出 82.5\% 的明显幻觉,FT-A+B+C 达到 98\%。与直觉相反,算术监督会放大而不是减轻各个层面的幻觉。我们将模板注入(无论输入内容如何都插入记忆的规范值)视为微调模型中的主要幻觉机制。这些发现表明,财务摘要中的数字幻觉是由领域适应导致的数字约束退化引起的,而不是由不充分的数字推理引起的。我们建议评估协议评估所有可检测级别的幻觉,并且部署实践包括用于接地感知生成或弃权的明确机制。

当金融微调失效时:领域适应语言模型中数值幻觉的三级可检测性分析:论文配图
图 1:不同模型变体的可检测性水平的幻觉率 (n=240)。 L1(公开):以货币计价的捏造; L2(隐秘-显式):没有货币标记的绝对数量; L3(隐蔽-隐式):无根据的定量主张。两个微调模型在所有三个可检测水平上都表现出比基本模型高得多的幻觉率,其中 FT-A+B+C 在 L1 和 L2 上均超过 FT-A。