论文

复杂城市场景中基于证据的可信多模态推理和评估基准

Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes

模型训练强化学习

摘要

虽然多模态 大语言模型 (MLLM) 在良性场景中表现出令人印象深刻的性能,但其认知可靠性在不利条件下的复杂场景中显着恶化。在这些设置中,模型通常依赖于隐式推理,而没有足够的视觉证据,导致感知和推理之间脱节。与此同时,现有的以结果为导向的基准仅评估最终预测,无法诊断潜在推理过程中的失败。为了解决这一差距,作者提出了 AD2-Bench,它引入了分层视觉诊断框架,将推理分解为结构化证据链 (CoE)。这种细粒度的诊断表明,稳健的多模态推理从根本上取决于准确的证据获取。在此基础上,作者从概率的角度进行推理,并确定了推理失败的两个主要原因: 空间模糊,模型无法区分目标对象和背景杂乱,导致定位错误;语义不确定性,其中退化的视觉特征导致不正确的语义解释,从而导致理解错误。为了克服这些证据缺陷,他们进一步提出了基于证据的视觉推理(EGVOR),它用证据原子的显式生成取代了隐式推理,证据原子是结构化的空间语义三元组,强制定位和语义理解之间的紧密结合。该模型通过分层课程进行训练,从反思监督构建发展到强化学习,其中减少推理方差得到明确奖励。大量实验表明,EGVOR 显着提高了不利条件下的推理稳定性,为值得信赖的多模态认知提供了更稳健的框架。