论文

SciFigAlign:通过视觉效果与手稿证据的微调对齐来对科学数据进行评分

SciFigAlign: Scoring Scientific Figures by Fine-tuned Alignment of Visuals with Manuscript Evidence

模型评测评测方法与指标

摘要

同行评审中的科学图形评估与一般图像质量评估有根本不同:图形必须视觉上清晰,忠实支持手稿的主张,并以清晰的视觉层次传达证据。然而,如果我们将传统的图像评估方法应用于科学图形质量评估,就会出现局限性:经典的 IQA 模型捕捉感知质量或美学,但无法判断图形是否符合论文的科学论点;基于 CLIP 的方法评估一般图像-文本对应关系,但缺乏对手稿上下文的理解;零样本 LLM/VLM 评委在重新用于数字评分时,通常会产生过于集中的分数,而视觉和文本证据的融合有限。我们引入了来自同行评审会议论文的 3,857 个科学数据的带注释数据集,每个数据集都按照四个同行评审导向的维度进行评级:清晰度、相关性、信息性和结构。我们提出了 SciFigAlign,这是一种经过微调的多模式评分器,可将图形质量评估建立在手稿证据中。给定图形裁剪、图注、引用段落和轻量论文上下文,SciFigAlign 通过按模态交叉注意力和 CubeMLP 融合对 CLIP 和 SciBERT 进行端到端微调,通过论文内排名铰链损失联合优化 SmoothL1 回归。在论文级分割下,SciFigAlign 在 n = 396 的测试集上实现了 0.3524 的宏观 MAE 和 81.64% 的论文内成对准确率,与 MAE 0.864 的最佳 LLM 作为判断基线相比,相对误差降低了 59%。消融证实,基于手稿的输入、引用上下文去噪和排名监督都是至关重要的,这表明科学的图形评估需要视觉内容和手稿证据之间的学习一致性,而不是单独提示,即使使用最先进的 VLM 也是如此。