论文

作为输出边界错误分类的幻觉:语言模型的复合弃权架构

Hallucination as output-boundary misclassification: a composite abstention architecture for language models

模型推理推理验证与自校正

摘要

大语言模型 经常产生不受支持的声明。我们将其视为输出边界处的错误分类错误,其中内部生成的补全被发出,就好像它们有证据一样。这激发了一种综合干预,将基于指令的拒绝与结构性弃权门相结合。该门根据三个黑盒信号计算支持赤字分数 St:自我一致性 (At)、释义稳定性 (Pt) 和引文覆盖率 (Ct),并在 St 超过阈值时阻止输出。在针对 50 个项目、五个认知体系和三个模型的受控评估中,单独使用任何一种机制都不够。仅指令提示显着减少了幻觉,但仍然对 GPT-3.5-turbo 的应答项目和残留幻觉表现出过度谨慎的放弃。结构门保留了跨模型的可回答的准确性,但错过了对相互矛盾的证据项目进行自信的讨论。该复合架构实现了较高的整体精度和较低的幻觉,同时还继承了指令组件的一些过度放弃。来自 TruthfulQA 的补充 100 项无上下文压力测试表明,结构门控提供了独立于能力的弃权底限。总体而言,基于指令的拒绝和结构性门控显示出互补的失败模式,这表明有效的幻觉控制受益于两种机制的结合。