论文

PaliBench:古典语言翻译基准的多参考蓝图

PaliBench: A Multi-Reference Blueprint for Classical Language Translation Benchmarks

模型评测基准与评测资源

摘要

数字人文项目越来越依赖机器翻译和 大语言模型 来扩大对古典、宗教和其他翻译不足的文本传统的访问。然而标准翻译基准不太适合此类材料:它们通常将系统输出与单个参考翻译进行比较,即使经典文本通常支持在术语、语域和解释方面不同的多个忠实翻译。本文介绍了 PaliBench,它既是巴利语到英语翻译的基准,也是构建古典语言多参考翻译基准的可重用方法。巴利语案例研究借鉴了《经藏》中的段落,并与苏加托比丘、塔尼萨罗比丘和菩提比丘的独立英文翻译相一致。该工作流程结合了 LLM 辅助的独立分段翻译对齐、针对源文件的自动验证、段落级质量过滤、公式重复的重复数据删除以及针对多个人工参考的多指标评估。生成的基准包含 1,700 个段落,涵盖 8,3​​89 个段和大约 345,000 个标记。我们用它来评估十个当代的 大语言模型 与补充指标,发现系统排名中强大的跨指标一致性以及可靠性和语义异常值率的巨大变化。更广泛的贡献是方法论上的:PaliBench 展示了如何将现有的学术翻译转变为解释性文本传统的评估基础设施,而不将任何单一翻译视为确定的。尽管该方法是为巴利语佛教文本开发的,但该方法可以移植到存在足够独立参考翻译的其他古典语料库。