论文

基于证据的回答:路侧交通场景中的一致性感知视觉定位问答

Answer with Evidence: Consistency-Aware Grounded Visual Question Answering for Roadside Traffic Scenes

应用与实践视觉感知与空间理解

摘要

路侧交通推理要求每项自由形式的文本陈述都有视觉证据支持。现有具有视觉定位能力的多模态大语言模型(MLLM)常出现“说—指不一致”,即文本答案与模型定位的边界框相矛盾。分别评价答案和边界框的指标不会惩罚这种错误。我们将其追溯到传统的“先回答、再定位”分解方式:在枚举任何对象之前,模型已经作出数量陈述。为测量该问题,我们构建包含34.7K问答对的RoadSceneVQA-G基准,每个自由形式答案都关联到证明它的一组边界框,并提出答案—定位一致性(AGC)评估套件。为解决该问题,我们提出“先枚举、再回答”(EtA),逆转生成顺序,使答案与证据的一致性成为输出结构的属性;同时提出枚举一致策略优化(ECPO),在强化学习阶段将多条执行轨迹的并集作为召回率教师信号,无需真实标注框。EtA将说—指一致性从26.6\%提高到93.7\%,将定位F1从52.2\%提高到73.0\%;ECPO在无需逐框监督的情况下将F1进一步提高到75.6\%。在gRefCOCO上,同一框架优于所比较的最强方法,表明其能够迁移到交通场景以外。项目:\url{https://github.com/GuanRunwei/RoadSceneVQA-G}。

基于证据的回答:路侧交通场景中的一致性感知视觉定位问答的原论文方法或结果图
图 3:拟议框架概述。第 1 阶段(上):枚举然后回答 (EtA) 在答案之前序列化视觉定位对象,因此从枚举的证据中读出答案,并且空框集对不视觉定位的决定进行编码。第2阶段(底部):枚举一致性策略优化(ECPO)从当前策略中采样$G$ 执行轨迹,通过IoU对其预测框进行池化和聚类,保持至少由$k$不同的执行轨迹支持的聚类作为共识集,并根据每个执行轨迹对该集的覆盖范围进行奖励。组相对优势通过 KL 正则化更新策略以获得冻结的 EtA-SFT 参考。