论文
用于科学图表理解的结构-词元证据-锚定推理
Structure-Token Evidence-Anchored Reasoning for Scientific Chart Understanding
摘要
科学图表用轴、图例和几何标记对数量进行编码,但大型视觉语言模型仍然将它们视为自然照片。视觉上下文示例不会暴露坐标系;不受约束的思维链可以命名一个从未从酒吧中读取过的看似合理的数字。我们提出了 STEER(结构词元证据锚定推理),它冻结了 Llama-3.2-Vision 编码器并插入三个模块:一个图表结构图形编码器(CSGE),用于绑定刻度、图例项和标记;证据锚定步骤推理(EASR),强制每个算术步骤引用图节点;弱解析器强推理器对齐(WPSR),仅使用专门的表提取器作为节点属性的教师。在 ChartQA 上,STEER 的平均松弛准确度达到 82.70,而 ChartGemma 的平均准确度为 80.16,在相同组合上训练的 LLaVA-CoT 主干网的平均准确度为 76.40。 CharXiv 推理(33.60 vs. 29.20 InternVL Chat V1.5)和 ChartQAPro CoT(40.70 vs. 37.17 Qwen2-VL-7B)的增益扩大,其中 OCR 快捷方式消失。消融表明,删除节点序列化或数字候选约束会消除大部分推理提升。