论文
从架构到输出:《大语言模型》中幻觉的结构起源和数据的放大作用
From Architecture to Output: Structural Origins of Hallucination in Large Language Models and the Amplifying Role of Data
摘要
大语言模型 产生流畅、自信、事实上错误的输出。现有的分类法按输出类型(内在与外在、忠实性 与事实)对这些故障进行分类,但没有提及哪个计算组件产生了给定的故障。我们询问需要什么才能将个人幻觉归因于仅解码器堆栈的特定组件。我们将三个组成部分——自注意力的联想检索、最大似然预训练目标和暴露偏差下的自回归承诺——视为候选失败表面,证明其可分离性而不是假设它,并指定仅需要采样访问的归因程序:对前缀、上下文和频率竞争的三种干预措施的有序集合,以及基于独立注释和分类器基线的验证设计。我们提出了五个可证伪的预测,并确定了每个都会歧视的竞争账户。我们分析指令调整、RLHF、DPO、检索增强、尺度和校准如何影响论证。我们对三个模型系列的承诺预测 (P3) 进行直接、预先注册的测试:在分歧点替换正确的延续,相对于基线而言,下游失败索赔减少了 46.7 个百分点 (p<10^-9)。然而,错误事实替换以统计上无法区分的比率减少了错误,并且该模型仅对替换成功的 2.2% 的项目单独正确回答——这是真正的部分结果,而不是确认。数据集病理学放大了每个组件,而不独立地引发故障,支持不对称依赖性主张:组件是数据引起的故障的必要中介,但数据缺陷对于组件引起的故障不是必需的。