论文

解字:经过专家审核的大型古汉字训诂数据集和基准

JieZi: A Large-Scale Expert-Audited Dataset and Benchmark for Ancient Chinese Character Exegesis

模型评测基准与评测资源

摘要

古代汉字的学术注释需要将视觉观察、语言分析和历史语境结合起来。然而,现有的计算方法狭隘地关注字符识别和检索等子任务,缺乏全面学术分析所需的结构化数据集和基准。为了解决这个限制,我们引入了古汉字训诂(ACCE),这是一种视觉语言问答(VQA)任务,可以模拟学术训诂过程。 ACCE分为四个渐进的级别:基本字符识别、字形分析、意义解释和历时演变分析。为了支持这项任务,我们构建了两个互补资源。 JieZi-Dataset 是 ACCE 第一个大规模、经过专家审核的 VQA 训练数据集,包含超过 50 万个 QA 对。它是通过管道构建的,该管道通过使用专家设计的模板和源文本引用来限制生成,从而减少事实错误。在每个关键阶段进一步应用人工验证,以确保学术准确性。 JieZi-Bench是一个与注释过程一致的评估基准,由人类专家构建和验证,以确保评估的可靠性。它由四个级别组成,参考答案来自与训练数据分开的权威词典著作。多模态 大语言模型 的实验表明,当前模型在基本识别方面表现良好,但在字形分析、语义推理和历时理解方面表现不佳。 JieZi-Dataset 上的 微调 显着提高了所有四个级别的性能。代码和数据集可在 https://github.com/Ran00w/JieZi 获取。