论文
基于证据的回答:路侧交通场景中的一致性感知视觉定位问答
Answer with Evidence: Consistency-Aware Grounded Visual Question Answering for Roadside Traffic Scenes
摘要
路侧交通推理要求每项自由形式的文本陈述都有视觉证据支持。现有具有视觉定位能力的多模态大语言模型(MLLM)常出现“说—指不一致”,即文本答案与模型定位的边界框相矛盾。分别评价答案和边界框的指标不会惩罚这种错误。我们将其追溯到传统的“先回答、再定位”分解方式:在枚举任何对象之前,模型已经作出数量陈述。为测量该问题,我们构建包含34.7K问答对的RoadSceneVQA-G基准,每个自由形式答案都关联到证明它的一组边界框,并提出答案—定位一致性(AGC)评估套件。为解决该问题,我们提出“先枚举、再回答”(EtA),逆转生成顺序,使答案与证据的一致性成为输出结构的属性;同时提出枚举一致策略优化(ECPO),在强化学习阶段将多条执行轨迹的并集作为召回率教师信号,无需真实标注框。EtA将说—指一致性从26.6\%提高到93.7\%,将定位F1从52.2\%提高到73.0\%;ECPO在无需逐框监督的情况下将F1进一步提高到75.6\%。在gRefCOCO上,同一框架优于所比较的最强方法,表明其能够迁移到交通场景以外。项目:\url{https://github.com/GuanRunwei/RoadSceneVQA-G}。
