论文
大语言模型如何引用来源?检索增强生成中归因机制的解释
How Do LLMs Cite? A Mechanistic Interpretation of Attribution in Retrieval-Augmented Generation
摘要
RAG通常通过引用外部文档提高可核查性,但模型是否真正依据所引来源生成答案,不能仅从行内引用判断。研究基于PopQA,在受控环境中对Llama-3.1-8B-Instruct进行激活修补,定位回答事实问题时决定是否附加引用的机制。引用不是由单一局部组件负责,而是由多个注意力头和MLP层组成的分布式、多阶段归因机制。在PopQA上,仅增强或抑制关键组件便能修复超过90%的漏引,消除69%的错误引用,且不损害答案准确率。在多文档HotpotQA上改善较小,但同一组件集合仍使引用率朝预期方向变化。结果提示,模型呈现的推理与内部计算路径可能不一致,行内引用可能造成错误的可信感。