论文

文字何时能取代视觉?图推理中的结构瓶颈

When Can Text Replace Vision? Structural Bottlenecks in Diagram Reasoning

模型评测评测方法与指标

摘要

结构化文本可以取代视觉进行图表推理吗?文本化后可能会出现错误的答案,因为表示忽略了问题所需的信息,或者因为求解器无法使用存在的信息。我们引入了一个诊断协议来区分这些解释。使用相同的求解器模型和生成设置,我们比较三种输入条件:原始图像、视觉语言模型提取的问题盲结构或从图表源导出的黄金结构。有效性触发的恢复测试截断和模式故障,与问题相关的保真度措施保存关键答案结构,匹配的边缘干预测试错误定位的效果。在保留的 240 个公共 FlowGen 图上,根据冻结协议进行评估,黄金结构的准确率达到 87%,而直接视觉和学习文本的准确率均低于 30%。聚合比较包括可能不会打印在图像中的源导出关系标签,并使用不同的学习和黄金图编码,因此它不能单独隔离提取错误。仅重试无效提取使得几乎每个公共表示模式都有效,但准确性基本不变。由于结构性困难,相对于黄金的公共知识文本赤字增加了一倍多。与问题相关的拓扑比全图拓扑更好地预测正确性。在一项公开的干预研究中,与答案相关的单个边缘编辑将主求解器的原始答案精度降低到接近零,而匹配的不相关编辑则在很大程度上保留了它。提供的结构比视觉需要更少的解决词元,但学习获取在单次使用时消除了这一优势。这些比较激发了通过所保留的与答案相关的证据以及求解器使用该表示的能力来评估所获取的文本。