论文

我们可以在没有人工参考的情况下对经典文本中的大语言模型翻译错误进行分类吗?通过巴利语-英语翻译实现来源新颖性、GEMBA 评分和预算审查

Can We Triage LLM Translation Errors in Classical Texts Without Human References? Source Novelty, GEMBA Scoring, and Budgeted Review through Pali-to-English Translation

模型评测评测方法与指标

摘要

随着大型语言模型成为经典文本的翻译者,一个关键的挑战是在不存在人类参考的情况下决定哪些输出需要专家审查。本研究通过巴利语到英语的翻译来测试无参考错误分类。三位大语言模型翻译了 15,493 篇文章。比较了五个信号:源新颖性、源候选嵌入距离、同行翻译分歧、英语到巴利语反向翻译和无参考 GEMBA 评分。信号在包含 3,000 项参考文献的 LLM 裁定样本上进行校准,并根据 500 项作者裁定的锚点进行检查。人类参考仅支持校准和验证;它们从未被用来计算风险信号。源新颖性是一个有用的源端风险先验,但不是每个候选错误检测器。同行分歧和反向翻译提供了次要信号。最有力的方法是无参考 GEMBA 评分,由一组通常被认为比翻译者更强的模型进行评分:通过 GEMBA 风险审查前 10%,捕获了校准集中 81.6% 的面板主要错误。 GEMBA 仍然是针对作者主播的最佳无参考信号。排除自我评分的同层小组仍然有用,但表现较差,这表明评估者的实力不仅仅限于提示。提出了一个预算工作流程,结合了源新颖性、同行分歧和更强的候选人意识判断来分配人工审核。转移到其他古典语言,包括拉丁语、古希腊语和梵语,仍有待测试。