论文

越简单越好:评估中世纪拉丁手稿的翻译管道

When Simpler Is Better: Evaluating Translation Pipelines for Medieval Latin Manuscripts

模型评测基准与评测资源

摘要

尽管机器翻译取得了显着进展,但视觉语言模型 (VLM) 在处理历史手稿方面仍举步维艰,这是一个强调核心自然语言处理 (NLP) 功能的领域:低资源音译、过时的词汇和嘈杂的输入信号。我们提出了一个系统框架,用于评估中世纪拉丁手稿的完整图像到翻译流程,在这种环境中,抄写速记、连字和羊皮纸退化暴露了在纯文本基准中不可见的故障模式。对 CATMuS Latin 数据集的基准测试揭示了专业化差距:与通用 VLM 相比,特定领域的光学字符识别 (OCR) 模型将字符错误率降低了高达 4.3$\times$,尽管运行参数少了几个数量级。我们推出了 Interpres-Parallel-Corpus (IPC),这是一个新颖的数据集,包含 1,383 个对齐的手稿图像行、转录和专家翻译,这是中世纪拉丁语的第一个此类数据集。我们的实验揭示了一个复杂性悖论:最简单的管道(直接输入 VLM 的专用 OCR 模型)优于所有多组件变体。添加检索增强生成 (RAG) 或 OCR 后校正会导致迅速饱和和错误传播,从而降低总体翻译质量。这些发现为在资源匮乏的历史环境中部署翻译系统提供了新的基准和实用指导。