论文

Q-CueGraph:用于多模态推理的查询条件视觉证据图

Q-CueGraph: Query-Conditioned Visual Evidence Graphs for Multimodal Reasoning

上下文与知识上下文工程

摘要

多模态 大语言模型 (MLLM) 可能会错过在近距离观察时识别的完整图像中的精细细节。恢复这些证据需要决定在哪里寻找以及保留多少周围环境。我们提出了 Q-CueGraph,一种针对冻结 MLLM 的查询条件证据获取方法。对于文本丰富的图像,它构建了可重复使用的 OCR 线条和布局关系图表。每个问题都会激活锚点,将其扩展到上下文区域,并为单个观察窗口选择候选者。查询条件对象检测通过相同的区域选择和合成接口支持自然图像搜索。轻量级候选评分器进一步从冻结的读者反馈和训练答案中了解哪些观察结果支持正确答案,而无需证据箱监督。通过六个基准,我们检查了查询调节、证据构成和学习可回答性的作用。借助 Qwen2.5-VL-7B,Q-CueGraph 使用 19.1% 的源图像区域将 V*Bench 精度从 0.696 提高到 0.832,并使用大约一半的图像区域在 InfographicVQA 上保留 92% 的全图像 ANLS。分析表明,有用的证据取决于其与问题的相关性以及读者可获得的上下文。 Q-CueGraph 在生成答案之前明确这些选择。