论文

HighlightBench:科学文档中标记驱动的表推理基准测试

HighlightBench: Benchmarking Markup-Driven Table Reasoning in Scientific Documents

模型评测基准与评测资源

摘要

视觉标记(例如突出显示、下划线和粗体文本)在以表格为中心的文档中很常见。尽管多模态 大语言模型 (MLLM) 在文档理解方面取得了实质性进展,但它们将此类线索视为明确逻辑指令的能力仍有待探索。更重要的是,现有的评估无法区分模型是否未能看到标记或未能对其进行推理。这在评估表上的标记条件行为时产生了一个关键盲点。为了解决这一差距,我们引入了HighlightBench,这是一种用于标记驱动表理解的诊断基准,它将评估分解为五个任务系列:标记基础、约束检索、局部关系、聚合\与比较以及一致性\和缺失。我们进一步提供了一个参考管道,使中间决策变得明确,从而实现可重复的基线和沿着感知到执行链的错误的更细粒度的归因。实验表明,当视觉线索必须在结构化输出约束下与符号推理一致时,即使是强大的模型也仍然不稳定。