论文

谨慎行事算作 忠实性 吗?重新评估 LVLM 幻觉缓解方法

Does Playing it Safe Count as Faithfulness? Reassessing LVLM Hallucination Mitigation Methods

模型评测鲁棒性、公平性与可信度评测

摘要

最近针对大型视觉语言模型(LVLM)的推理时间幻觉缓解方法报告在幻觉基准上取得了巨大进步。然而,目前尚不清楚较低的幻觉分数是否反映了多模式基础的改善或更保守的一代。我们评估了三个 LVLM 和四个基准的六种缓解方法,包括以幻觉为中心的评估和多样化的能力基准 MMStar。我们的分析揭示了两种一致的模式。首先,幻觉的减少通常伴随着信息量的减少:降低幻觉率的方法也会减少物体回忆、视觉覆盖范围或反应细节。其次,幻觉基准的改进并不能可靠地转化为更广泛的多模式能力,方法在细粒度感知和推理任务上表现出不一致或下降的性能。我们的研究结果表明,当前的评估协议可能会通过奖励保守一代来高估进展。我们认为,幻觉缓解应该作为 忠实性(信息性)能力权衡来评估,而不是仅仅通过幻觉分数来评估。