论文

从异常值到错误:通过多参考裁决审核巴利语到英语的 LLM 翻译

From Outliers to Errors: Auditing Pali-to-English LLM Translations with Multi-Reference Adjudication

模型评测评测方法与指标

摘要

单分翻译指标可能会将合法的变异与错误混为一谈,对于古典语言来说,这个问题尤其严重,因为同一段落的多种合理的英语翻译共存。我们审核了四个旗舰 大语言模型 (LLM) 的巴利语到英语的输出:GPT-5.5、Claude Sonnet 4.6、Gemini 3.1 Pro 和 Grok 4.3,来自巴利经典的 1,700 个段落,使用 Bhikkhu Sujato、Thanissaro Bhikkhu 和 Bhikkhu Bodhi 的三个已建立的人工翻译作为本地翻译参考信封而不是单一的黄金标准。每个候选者相对于参考质心的归一化嵌入漂移用作分类信号,而不是错误标签;然后,超过 1.5 漂移阈值的 1,203 名候选者将由盲法三模型 LLM 评审小组进行裁决,并根据 300 个实例作者裁决的验证集进行校准。有两个结果很突出。首先,漂移预测严重性而不是错误本身:判定的高漂移候选者中的重大错误率从 1.5-2.0 范围内的 7.9% 单调上升到 3.0 以上的 51.6%,而 1.5-2.0 异常值中大约 80% 被判定为有效的翻译变化。其次,模型差异在高漂移尾部最为明显:GPT-5.5 的判定高漂移重大错误率最低,置信区间与 Claude Sonnet 4.6 和 Gemini 3.1 Pro 重叠; Grok 4.3 具有最大的异常值体积和最高的尾部重大错误率(总体为 27.6%,比漂移 3.0 高出 74.4%)。占主导地位的重大错误类别(例如遗漏或截断、教义术语错误)恰恰是最有可能误导教义文本读者的失败。其贡献是针对古典到现代翻译的可重用审核设计:定义来自多个人工翻译者的本地参考信封,使用嵌入漂移来确定审查的优先级,并裁决标记的尾部,而不是将异常状态视为错误。