论文

Komi-Yazva--零样本和少样本翻译的俄语平行语料库和评估协议 LLM

A Komi-Yazva--Russian Parallel Corpus and Evaluation Protocol for Zero- and Few-Shot LLM Translation

模型评测基准与评测资源

摘要

我们提出了第一个 Komi-Yazva——俄语平行语料库以及一个明确的评估协议,用于在濒危、资源极少的环境中研究 LLM 翻译。该数据集包含来自 74 个叙述文本的 457 个对齐句子对,并附有记录的出处、句子级对齐和故事标识符,可实现泄漏感知评估。我们使用此设置来比较现代 大语言模型 在 Komi-Yazva 到俄语翻译上的情况,在零样本和基于检索的少样本机制中严重并行数据稀缺的情况下。该协议包括故事级交叉验证、少量提示的确定性检索、生成输出的严格验证、基于参考和基于判断的补充指标以及故事级不确定性估计。在各个模型中,LLM 都会产生不平凡的翻译,但性能因模型系列和提示机制而异。基于检索的少样本提示始终优于零样本提示,而超出小检索上下文的收益仍然有限。结果表明,这种情况下的评估结论在很大程度上取决于度量选择和失败处理,因此本文将语料库构建为濒危语言机器翻译的数据集贡献和可重复的评估测试平台。