论文

指令镜头分数:您的指令为多模态 大语言模型 提供了强大的物体幻觉检测器

Instruction Lens Score: Your Instruction Contributes a Powerful Object Hallucination Detector for Multimodal Large Language Models

模型评测评测方法与指标

摘要

多模态 大语言模型 (MLLM) 已经取得了显着的进展,但物体幻觉仍然是可靠部署的关键挑战。在本文中,我们对指令标记嵌入进行了深入分析,并揭示了它们隐式编码视觉信息,同时有效过滤了误导性视觉嵌入引入的错误信息。基于这一见解,我们提出了指令透镜分数(InsLen),它将校准的本地分数与衡量对象标记的上下文一致性的上下文一致性分数相结合。所提出的方法可用作即插即用的物体幻觉检测器,无需依赖辅助模型或额外的训练。跨多个基准和不同 MLLM 架构的大量实验表明,InsLen 始终优于现有的幻觉检测方法,凸显了其有效性和鲁棒性。代码可在 https://github.com/Fraserlairh/Instruction-Lens-Score 获取。