论文

提出位置并检查注意力:无需训练的多模态定位置信度估计

Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention

模型推理推理验证与自校正

摘要

多模态 大语言模型 可以发出局部预测、对象的边界框以及视频和音频事件的时间窗口,但它们会大量产生幻觉。模型自己的词元对数概率几乎没有提供任何信息:它们将定位质量与输入模糊性混为一谈,并且一旦模型提交,坐标词元就变得接近确定性。我们提出多词元局部注意力(MTLA):无需训练,事后评分,用于衡量预测的词元对其声称的区域的关注程度。先前基于注意力的检测器将注意力集中在整个输入模态上并读取单个响应标记,是较弱的特殊情况;我们表明,仅在所声明的区域内求和并在所有预测标记之间进行聚合可以恢复更强的定位信号。同样的方法几乎适用于其他模式和任务:图像中的对象检测以及视频和音频中的时间定位。在多个 MLLM 系列和三种模式中,MTLA 将幻觉 AUROC 比之前最好的 无需训练 基线改善了 +7 至 +38。用作重新排名的置信度得分,它几乎使开源 8B 通才的零样本 COCO 检测 AP 翻倍(从 20.4 到 37.0),缩小了与没有任何特定任务训练的监督检测器的差距。