论文
CVIF:MLLM中用于理解几何图的关键驱动视觉干预框架
CVIF: A Criticality-Driven Visual Intervention Framework for Geometric Diagram Understanding in MLLMs
摘要
尽管 Multimodal 大语言模型 (MLLM) 在视觉任务方面取得了重大进展,但由于稀疏的视觉线索和模糊的符号原始关联的存在,几何图理解仍然具有挑战性。因此,MLLM可能依赖于文本先验,产生与视觉证据相冲突的解释。我们引入了无需训练关键性驱动的视觉干预框架(CVIF),这是一种推理时方法,可在从证据聚合到语义解码的过渡过程中定位关键层并执行视觉干预。在这些层中,几何约束局部关系重建 (GCLR) 模块选择并加权以顶点为中心的视觉证据,而自适应视觉转向算子 (AVSO) 将注意力质量重新分配给选定的token。在 PGPS9K 和 PGDP5K 上的实验表明,CVIF 分别将整体 F1 从 77.85 提高到 85.58,从 75.23 提高到 82.84,建立了一种新颖的推理时视觉干预范式。
