论文
超越单个字符:评估句子级甲骨文理解的 MLLM
Beyond Single Character: Evaluating MLLMs for Sentence-Level Oracle Bone Inscription Understanding
摘要
现有的人工智能辅助甲骨文(OBI)视觉识别和理解研究主要集中在字符层面,忽略了完整占卜费用中嵌入的长篇文本连贯性和上下文依赖性。最近,多模态大语言模型(MLLM)强大的视觉感知能力为OBI信息处理开辟了新的可能性。在这项工作中,我们引入了 S-OBI,这是一种用于评估句子级 OBI 理解中的 MLLM 的新颖基准。 S-OBI 没有使用嘈杂和不完整的拓片作为视觉输入,而是通过字形替换和组合来合成清晰且标准化的句子级 OBI 实例。根据经过专家鉴定、更正和验证的 95 个原始拓片及其翻译,我们用来自现有 OBI 数据集的相应干净字形样本替换了原始拓片中的字符,同时保留了整体铭文结构和语义组织。这减轻了底层扭曲的影响,并能够对句子级 OBI 理解进行更集中的评估。基于此,我们设计了语义匹配、语义槽提取和上下文推理任务,并获得了 695 个问答对。实验揭示了当代 MLLM 在句子级 OBI 理解上的劣势。特别是,未屏蔽区域中的视觉感知错误通过推理链传播,导致对屏蔽字符的错误预测,这表明当前模型中的句子级 OBI 理解仍然强烈依赖于字符级识别。总体而言,S-OBI 提供了一个诊断基准,用于评估 MLLM 是否可以超越孤立的字符识别,转向结构化的铭文级理解。