论文
自由职业者翻译分析 II:机密翻译工作流程的本地 LLM 基准测试
Translation Analytics for Freelancers II: Benchmarking Local LLMs for Confidential Translation Workflows
摘要
基于我们之前的工作,本文为自由译者和小型语言服务提供商开发了实用、低门槛的方法,以使用严格且易于理解的分析方法来评估翻译技术。在这里,我们解决了一个高风险的专业需求:对机密性敏感领域的离线翻译,其中隐私限制阻碍了基于云的引擎和商业 LLM 的使用。我们通过添加句子对齐的德语和简体中文参考翻译,将之前工作中使用的里夫基金会三语语料库(RFTC)扩展为多语言语料库(RFMC)。然后,我们对从该语料库中选择的 1000 多个句子跨四个语言方向的几个本地可运行的语言模型(通过 Ollama)进行基准测试。我们使用一致的单提示调用,无需 微调 或域适应,将本地 LLM 输出与商业 NMT(DeepL、百度)、前沿 LLM (GPT-5.2) 和专业级本地 NMT 系统(OPUS-CAT、NeuralDesktop、Promt)进行比较。使用 MATEO 进行自动评估。结果显示,不同语言方向和模型大小的局部 LLM 性能存在显着差异。最好的本地 LLM 可以匹配或超越本地 NMT 系统和前沿 LLM,尽管它们仍然落后于顶级商业 NMT。这些发现强调了为隐私受限的专业人士精心挑选的本地 LLM 翻译的可行性,并为未来关于模型扩展和多语言能力的研究提供了信息。