论文

MultAttnAttrib:长文档问答中的 无需训练 多模态归因

MultAttnAttrib: Training-Free Multimodal Attribution in Long Document Question Answering

模型评测评测方法与指标

摘要

随着有证据依据的问答系统越来越多地部署在人工智能助手中,将生成的答案准确归因于证据对于用户信任和模型安全至关重要。虽然单模态归因已得到深入探讨,但多模态设置的研究仍然相对不足。因此,我们引入了 MultAttnAttrib,这是一种 无需训练 归因生成方法,它利用模型的预填充通道、选定的注意力头和校准阈值来定位文档中的源证据。为了建立该方法的基线结果,我们引入了 MultAttrEval,这是一个补充基准数据集,用细粒度的 真值 属性注释,用于基于多模式源文档的答案组件。据我们所知,这是第一个专门为长格式文档中的多模式归因而设计的评估数据集。实验结果表明,MultAttnAttrib 始终优于各种归因生成方法,包括几种基于强提示的方法,并且与最新的前沿模型(例如 GPT 5.4)相匹配。我们的方法不仅大大提高了单模态和多模态归因类型的归因准确性,而且与相同基础模型上的提示相比,生成归因的速度高达直接推理延迟的七分之一。