论文

多语言长篇演讲​​教学如下:KIT 向 IWSLT 2026 提交的材料

Multilingual Long-Form Speech Instruction Following: KIT's Submission to IWSLT 2026

模型训练合成数据

摘要

随着 大语言模型 的出现,单任务和基于标记的多任务模型已经发展成为基于指令的系统,可以从自然语言提示中隐式推断任务和目标语言。这一趋势反映在 IWSLT 的指令跟踪轨道中,该轨道今年引入了新任务,包括未知的惊喜任务,对已知任务的过度拟合提出了真正的挑战。我们展示了 KIT 在无约束环境下对长指令跟踪和短指令跟踪轨道的提交。我们的方法结合了通用数据增强管道,通过分段串联、基于 LLM 的标签生成和跨语言翻译,将短格式语料库转换为长格式训练数据,在六种任务和四种语言中生成超过 100 万个实例。我们进一步表明,基于似然的重新排序虽然对 ASR 非常有效,但通过错误地选择分段音频处理生成的候选者而不是整体长形式推理,系统地降低了语义任务的质量,这是通过将似然与最小贝叶斯风险解码相结合解决的故障模式。