论文
TransClean:从 大语言模型 输出中检测和提取干净翻译的基准
TransClean: A Benchmark for Detecting and Extracting Clean Translations from Large Language Model Outputs
摘要
大语言模型 (LLM) 越来越多地用于机器翻译,但它们的输出通常包含翻译本身之外的附加文本,例如语言标签、解释或双语重复,我们将其称为翻译噪声。尽管这个问题普遍存在,但缺乏专门的基准和系统的研究。我们分析了 22 个语言对 (LP) 中 12 个 LLM 的超过 790,000 个翻译输出,并识别了 12 种重复出现的噪声模式,我们将其分为格式噪声和内容噪声。基于观察到的模式,我们构建了 TransClean,这是一个包含 9,900 对噪声和干净翻译输出的受控基准,其中包括 8,800 个综合生成的实例和 1,100 个手动策划的真实实例。我们在 TransClean 基准上评估了两种提取方法:1)基于跨度的提取方法,利用翻译质量估计模型进行跨度检测;2)基于 LLM 的提取方法,提示 LLM 隔离翻译。我们的基准测试和分析提供了第一个系统框架来评估和提高 LLM 翻译输出的清洁度。