论文

HydraQE:俄勒冈州立大学提交的 IWSLT 2026 语音翻译指标共享任务

HydraQE: OSU's Submission for the IWSLT 2026 Speech Translation Metrics Shared Task

模型评测评测方法与指标

摘要

我们介绍 HydraQE,这是我们对 IWSLT 2026 语音翻译指标共享任务的贡献。 HydraQE 是一种基于 Qwen3-ASR 主干的语音翻译端到端、无参考质量估计 (QE) 系统,该系统接受源音频和翻译假设作为联合输入。所有骨干层的隐藏状态通过可学习的稀疏最大标量混合进行组合,然后由轻量级双向 Transformer 重新编码,以在池化到共享嵌入之前实现完整的跨模式交互。三个独立的预测头接受互补监督信号的训练:人类直接评估 (DA) 注释、MetricX-24 伪标签和 xCOMET 伪标签。为了解决人工注释数据的稀缺问题,我们将综合损坏的示例和银色伪标记机器翻译输出相结合进行训练,使用从合成和银色数据开始并逐渐转向人工注释示例的课程。 HydraQE 的性能优于基于文本的级联基线和先前的直接语音 QE 系统,这表明端到端语音翻译 QE 与级联方法相比具有竞争力。