论文

CVIF:MLLM中用于理解几何图的关键驱动视觉干预框架

CVIF: A Criticality-Driven Visual Intervention Framework for Geometric Diagram Understanding in MLLMs

模型推理推理验证与自校正

摘要

尽管 Multimodal 大语言模型 (MLLM) 在视觉任务方面取得了重大进展,但由于稀疏的视觉线索和模糊的符号原始关联的存在,几何图理解仍然具有挑战性。因此,MLLM可能依赖于文本先验,产生与视觉证据相冲突的解释。我们引入了无需训练关键性驱动的视觉干预框架(CVIF),这是一种推理时方法,可在从证据聚合到语义解码的过渡过程中定位关键层并执行视觉干预。在这些层中,几何约束局部关系重建 (GCLR) 模块选择并加权以顶点为中心的视觉证据,而自适应视觉转向算子 (AVSO) 将注意力质量重新分配给选定的token。在 PGPS9K 和 PGDP5K 上的实验表明,CVIF 分别将整体 F1 从 77.85 提高到 85.58,从 75.23 提高到 82.84,建立了一种新颖的推理时视觉干预范式。

CVIF:MLLM中用于理解几何图的关键驱动视觉干预框架的原论文方法或结果图
图 4:CVIF 概述。分层归一化预测熵为在预测形成期间选择候选关键层提供了诊断。在这些层上,GCLR 利用几何顶点作为锚点来显式解耦和重建局部结构的空间语义映射。随后,AVSO 对注意力进行分布整形和增强控制,实现主动视觉召回率和预测校正。