论文
视频问答的目标检查可靠性评分细化
Target-Checked Reliability Score Refinement for Video Question Answering
摘要
视频语言模型可以高置信度地回答多项选择题,但也会出错。我们研究了在目标转移下是否可以提高答案级别的可靠性分数,而无需重新训练模型或更改其答案。我们从四个确定性视频采样下的三个固定视频语言模型收集选项概率列表,并将跨视图变化和跨模型一致性表示为响应图。使用标记的目标飞行员,我们将原始分数(定义为分配给所选答案的概率)与在开发数据集上训练的基于直方图的梯度提升(HGB)分数和在目标飞行员上训练的正则化逻辑回归分数进行比较。仅当重复的视频级别检查表明有积极、稳定的改进时,候选者才会替换原始分数。我们在公共 VideoQA 基准和视频幻觉诊断 (VHD) 上制定了此规则,这是一个针对共享高置信度错误的受控诊断数据集。排名质量通过风险覆盖曲线下的面积(AURC)来衡量,其中越低越好。在保留的 963 个问题 HERBench 拆分中,该方法将三个模型的平均 AURC 降低了 16.64%(95% 置信区间 (CI),12.12% 至 22.61%);最小模型级增益为11.39%。在单独保留的 911 个问题感知测试中,平均减少量为 18.87%(95% CI,15.43 至 22.14%)。对于 InternVL3.5,目标检查保留原始分数。使用相同的输出,该方法在两个数据集上的平均 AURC 优于七个无训练基线。它还改进了 AUROC,减少了校准误差,并将 50% 覆盖率下的误差率降低了 6.50 和 6.58 个百分点。