论文
重新审视视觉问答的贪婪解码:校准视角
Revisiting Greedy Decoding for Visual Question Answering: A Calibration Perspective
摘要
大语言模型(LLM)广泛采用随机采样策略来平衡输出的一致性和多样性。这些启发式方法通常在多模式 LLM (MLLM) 中继承,而无需特定于任务的理由。然而,我们认为随机解码对于视觉问答 (VQA) 来说可能不是最佳的。 VQA 是一项封闭式任务,其答案分布很繁琐,其中的不确定性通常是认知性的,是由于缺失或模糊的视觉证据而不是合理的延续而产生的。在这项工作中,我们提供了模型校准和预测准确性之间关系的理论形式化,并推导了贪婪解码最优性的充分条件。大量的实验提供了经验证据,证明贪婪解码在多个基准上优于随机采样。此外,我们提出了推理模型的贪婪解码,它在多模态推理场景中优于随机采样和标准贪婪解码。总的来说,我们的结果警告不要在 MLLM 中天真地继承 LLM 解码启发式,并证明贪婪解码可以是 VQA 的高效但强大的默认值。