论文

编码但未路由:解释科学声明验证中的图表差距

Encoded but Not Routed: Explaining the Table-Chart Gap in Scientific Claim Verification

模型评测模型行为与机制分析

摘要

多模式 LLM 越来越多地用于协助科学同行评审,其核心要求是验证论文中的主张是否得到证据支持。先前的工作表明,当证据是表格时,模型在这项任务上的表现比当证据是相同基础数据的图表时要好得多。这就提出了一个问题:模型是否无法从图表中提取信息,或者它们提取了信息但在形成预测时未能使用它?我们通过对代表相同基础数据的表格和图表证据的三个开放权重 VLM 进行分层线性探测和注意力分析来研究这个问题。我们找到了后者的一致证据。图表信息被编码在模型的中间表示中,但未到达预测位置,这是表格中不存在的差距,并且适用于所有测试条件。注意力分析进一步表明,这种脱节在模型系列中采取了两种架构上不同的形式。这些发现表明,将表格与图表之间的差距重新定义为在预测时使用编码视觉信息的失败,而不是编码本身的失败。