论文
EviSI:基于证据的同声传译评估代理
EviSI: An Evidence-Based Evaluation Agent for Simultaneous Interpreting
摘要
低延迟同步语音到语音翻译必须与正在进行的语音保持同步,同时保留关键信息。为了满足这些需求,系统使用分段、重新表述和压缩来重新组织和重新表述信息。然而,为文本翻译开发的指标(包括 BLEU 和 COMET)可能无法始终区分忠实的改编和语义错误。我们提出 EviSI,一种 大语言模型 评估代理,将多维质量指标 (MQM) 与专业口译员制定的标准相结合。共享源证据指导四个维度的评估:锚点、事件、逻辑和流畅性。在进行确定性评分之前,会删除已验证的错误的重复数据。在人类评分的英汉和汉英数据上,EviSI 恢复了英汉人类系统的总体排名。系统排名的数据集内平均 Kendall 相关性分别达到 0.707 和 0.467,超过了评估的 BLEU 和 COMET 基线。没有人工评分的五个方向的多语言扩展保留了维度和评分规则,显示出与 COMET 整个系统排名的正相关性。