论文

走向表征科学图像实用性和可升级性

Towards Characterizing Scientific Image Utility and Upgradability

模型评测基准与评测资源

摘要

科学图像是研究交流中的关键证据,但其完整性面临着人工智能生成的内容带来的前所未有的威胁,这些内容引入了微妙但后果严重的错误。现有的评估范式被证明是不够的:感知质量指标与科学有效性的相关性很差,而语言模型缺乏特定领域的验证能力。为了解决这一差距,我们提出了 \textbf{S}cientific \textbf{I}mage \textbf{U}tility 和 \textbf{U}pgradability \textbf{A}ssessment (\textbf{SIU$^2$A}) 框架,该框架引入了科学图像评估的两个互补维度。 \textbf{实用程序}包括\textit{错误检测}(识别科学错误)和\textit{纠正可行性}(评估错误是否可以可靠地修复)。 \textbf{可升级性}衡量修正的质量。我们将科学图像损坏分为四种基本类型:细节失真、不完整性、虚假内容和实体混淆。基于这个分类法,我们构建了 SIU$^2$A-Benchmark,这是一个带有专家注释的数据集,用于错误识别和修复。该框架实现了一个两阶段评估协议:\textit{Utility}阶段评估错误检测能力和修复指令生成,而\textit{Upgradability}阶段评估修正是否忠实地恢复科学有效性而不损害现有的准确信息。实验表明,当前的多模态系统在科学错误评估和忠实校正方面都表现出显着的局限性,暴露了视觉感知和科学可用性之间的根本差距。