论文

通过基于组件的多模态知识增强专门用于 Oracle Bone 脚本解释的大型模型

Specializing Large Models for Oracle Bone Script Interpretation via Component-Grounded Multimodal Knowledge Augmentation

智能体系统Agent 架构与控制循环

摘要

破译中国古代甲骨文(OBS)是一项具有挑战性的任务,它可以让我们深入了解古代的信仰、制度和文化。现有的方法将破译视为一个封闭的图像识别问题,这无法弥合“解释差距”:虽然单个字符通常是独特且罕见的,但它们是由一组有限的重复出现的象形组件组成,这些组件带有可转移的语义含义。为了利用这种结构逻辑,我们提出了一种代理驱动的视觉语言模型(VLM)框架,该框架将用于精确视觉基础的 VLM 与基于 LLM 的代理集成在一起,以自动执行组件识别、基于图形的知识检索和关系推理的推理链,以实现语言上准确的解释。为了支持这一点,我们还引入了 OB-Radix,这是一个专家注释的数据集,提供先前语料库中缺少的结构和语义数据,包括 1,022 个字符图像(934 个独特字符)和 478 个不同组件的 1,853 个细粒度组件图像,并具有经过验证的解释。通过在不同任务的三个基准上评估我们的系统,我们证明与基线方法相比,我们的框架可以产生更详细和更精确的解读。