论文

SciFigQual-Bench:具有完整手稿背景的科学图形质量评估基准

SciFigQual-Bench: A Benchmark for Scientific Figure Quality Assessment with Full-Manuscript Context

模型评测基准与评测资源

摘要

科学图形的质量与手稿息息相关:裁剪图可以在视觉上清晰,但仍然与其图注或引用它的段落相矛盾。大多数图像质量评估和图表理解方法的目标是独立的视觉表面或问答得分,而不是图形、图注和引用文本之间的对齐。将图像和文本结合在一起的单个端到端提示仍然将可见内容与图注和引用段落声明的内容混合在一起,因此流畅的措辞可以提高视觉分数,而缺失的文本可以被视为低质量。为了解决这一差距,我们引入了 SciFigQual-Bench,这是一种针对已发表的计算机科学会议图表的手稿链接基准,它将每个图表与其图注和索引解析的引用段落绑定在一起,并对视觉清晰度、布局、图注一致性、上下文一致性和误导性风险进行评分,当证据不存在时,会留下未评估的维度。 SFQ-Agent 在单独的调用中读取图像和文本,并记录特定于模态的证据。跨模式法官对这些报告中的图注和引用文本对齐进行评分,确定性跑步者保留视觉分数,通过固定规则设置误导性风险,并应用书面上限,因此每个维度都遵循图注,而不是单个端到端提示。将该分阶段评审与单通道和 OCR-sidecar 协议进行比较的实验发现,分阶段评审下的平均人类评分最接近的点估计拟合,而协议之间的差距仍然很小。图注一致性仍然是主要差距,与评分者平均值的一致性回答了与人类评分者之间的一致性不同的问题。