论文

通过字形驱动增强古汉字演化分析的多模态 大语言模型 微调

Enhancing Multimodal Large Language Models for Ancient Chinese Character Evolution Analysis via Glyph-Driven Fine-Tuning

模型训练监督微调与指令调优

摘要

近年来,多模态 大语言模型(MLLM)的快速发展日益刺激了对中国古代文字的研究。由于书面字符的演变构成了理解文化转型和历史连续性的基本途径,因此如何系统地利用 MLLM 来支持和推进文本演变分析仍然是一个开放且很大程度上尚未探索的问题。为了弥补这一差距,我们构建了一个包含 11 项任务和超过 130,000 个实例的综合基准,专门用于评估 MLLM 分析古代汉字演变的能力。我们对多个广泛使用的 MLLM 进行了广泛的评估,并观察到,虽然现有模型在字形级别比较方面表现出有限的能力,但它们在核心任务(例如字符识别和进化推理)上的性能仍然受到很大限制。受这些发现的启发,我们提出了一个字形驱动的 微调 框架(GEVO),该框架明确鼓励模型捕获字形转换中的进化一致性,并增强它们对文本进化的理解。实验结果表明,即使是 2B 规模的模型,在所有评估的任务中也能实现一致且全面的性能改进。为了方便未来的研究,我们公开发布了基准测试和经过训练的模型\footnote{https://github.com/songruiecho/GEVO}。