论文
当金融微调失效时:领域适应语言模型中数值幻觉的三级可检测性分析
When Financial Fine-tuning Fails: A Three-Level Detectability Analysis of Numerical Hallucination in Domain-Adapted Language Models
摘要
金融大语言模型越来越多地用于报告和披露的摘要,其中数字幻觉带来了重大的实际风险。虽然之前的工作经常将这种幻觉归因于数字推理不足,但这一假设尚未在受控微调设置下进行系统测试。在本文中,我们对财务摘要中的数字幻觉进行了一项经济高效的对照研究,涉及三种模型变体:基本指令调整模型、领域语言适应模型 (FT-A) 和数学增强领域模型 (FT-A+B+C)。我们引入了三级可检测性分类法,区分显性幻觉(以货币计价的捏造)、隐性显性幻觉(专业会议数字)和隐性隐性幻觉(无根据的定量主张)。我们的结果表明,域微调大大降低了所有可检测水平的数值限制。虽然基本模型保持接近于零的幻觉率 (5.4\%),但 FT-A 表现出 82.5\% 的明显幻觉,FT-A+B+C 达到 98\%。与直觉相反,算术监督会放大而不是减轻各个层面的幻觉。我们将模板注入(无论输入内容如何都插入记忆的规范值)视为微调模型中的主要幻觉机制。这些发现表明,财务摘要中的数字幻觉是由领域适应导致的数字约束退化引起的,而不是由不充分的数字推理引起的。我们建议评估协议评估所有可检测级别的幻觉,并且部署实践包括用于接地感知生成或弃权的明确机制。
