论文

利用视觉信号实现视觉语言生成中的稳健 词元级 不确定性

Leveraging Visual Signals for Robust Token-Level Uncertainty in Vision-Language Generation

模型评测评测方法与指标

摘要

不确定性量化 (UQ) 仍然是大视觉语言模型 (LVLM) 中可靠预测和实际部署的关键挑战。然而,大多数现有方法均改编自 LLM 文献,并且主要关注语言模态,而视觉信息对 LVLM 不确定性的贡献在很大程度上尚未得到充分探索。在本文中,我们研究了 LVLM 如何处理视觉信息以及该过程是否可用于改进不确定性估计。通过分析生成过程中视觉特征整合后的隐藏表示,我们观察到高置信度预测比不确定预测更依赖于视觉内容。基于这一见解,我们提出了 Visual-Grounded Token UQ (VIG-TUQ),这是一个 无需训练 框架,通过用视觉基础分数对 词元级 语言不确定性进行加权,明确地将视觉基础纳入不确定性估计中。我们在多个数据集和不同的 LVLM 架构上评估 VIG-TUQ,包括早期融合、后期融合和本机融合模型。结果表明,我们的方法通常改进了现有的 词元级 不确定性方法。代码和数据将在接受后提供。