论文

用于MLLM零样本任务验证与增强的显式逻辑通道

Explicit Logic Channel for Validation and Enhancement of MLLMs on Zero-Shot Tasks

模型推理推理验证与自校正

摘要

前沿多模态大语言模型(MLLM)在视觉语言理解(VLC)任务上展现出卓越能力。然而,它们常以黑箱方式作为面向新任务的零样本方案被部署。验证和理解这些模型的行为对于将其应用于新任务变得重要。我们提出显式逻辑通道(Explicit Logic Channel),与黑箱模型通道并行,执行显式逻辑推理以实现模型验证、选择与增强。封装了潜在视觉语言知识的前沿MLLM可被视为隐式逻辑通道。所提出的显式逻辑通道模仿人类逻辑推理,融合一个LLM、一个VFM以及带概率推断的逻辑推理,对显式视觉证据进行事实性、反事实和关系推理。我们提出一致性率(CR)用于跨通道验证与模型选择,即使没有真值标注也可使用。此外,跨通道整合进一步提升了MLLM在零样本任务上的表现,并以显式视觉证据为依据增强可信度。我们针对两个代表性VLC任务(即MC-VQA和HC-REC),在三个有挑战性的基准上,对来自4个前沿家族的11个近期开源MLLM进行了全面实验。系统性评估表明,所提出的ELC与CR在MLLM的模型验证、选择与改进上是有效的,并提升了可解释性与可信度。

用于MLLM零样本任务验证与增强的显式逻辑通道:论文配图
图 1:用于零样本设置中新型 VLC 应用的 MLLM 模型验证和选择(上)以及性能增强(下)的显式逻辑通道 (ELC) 图示,无需真实注释。在 ELC 中,我们结合 LLM、VFM 和逻辑推理来得出对 VLC 任务的明确且具体的视觉证据和逻辑验证的预测。