论文

TeochewBench:潮州汉字翻译的人工审核基准

TeochewBench: A Human-Reviewed Benchmark for Teochew Hanzi Translation

模型评测基准与评测资源

摘要

潮州话拥有庞大的使用者群体,并表现出独特的词汇、句法和语用特征,但用于评估大型语言模型的文本资源仍然有限。我们推出了 TeochewBench,这是一个由 300 个潮州汉字表达组成的人工审核基准,用于评估从潮州汉字到普通话和英语的翻译。该数据集涵盖五个类别:基础词汇;日常句子;潮州话特有的表达方式;语气、礼貌和语境;以及惯用的、模棱两可的和文化特定的表达方式。一位主要讲潮州话的审稿人单独检查了所有条目并根据需要进行修改,而另外两名讲潮州话的审稿人则验证了选定的项目。我们的主要评估涵盖了在两个翻译方向上审查的数据集上的 11 个官方通用后训练模型,产生了 6,600 个预测。两个官方基地检查点提供 1,200 个预测用于补充诊断,使总数达到 13 个模型和 7,800 个预测。我们还包括一个汉字复制控件,它会返回源输入不变,以评估共享汉字如何影响翻译成普通话的自动分数。 Qwen3.5-27B 在评估的检查点中获得了最高的 chrF 式总体得分,为 60.63,其次是 Qwen2.5-72B-Instruct(56.61)、Gemma-3-27B-IT(56.36)和 GLM-4-32B-0414(55.82)。在 11 个主要评估模型中,平均 chrF 风格得分从低特异性项目的 69.25 下降到高特异性项目的 27.52。高特异性表达得分较低,并且表现出较小的跨模型差异,这表明它们构成了此处评估的模型家族的共享低分区域。汉字复制控制进一步表明,低特异性项目中的表面重叠可以显着影响翻译成普通话的自动评分。