论文

面向视觉语音识别的扩散大语言模型

Diffusion Large Language Models for Visual Speech Recognition

应用与实践内容创作

摘要

现有的视觉语音识别 (VSR) 系统通常依赖于从左到右的自回归解码,这可能会在有足够的上下文可用之前强制对视觉上模糊的标记做出过早的决策。据我们所知,我们提出了 DLLM-VSR,这是第一个基于扩散大语言模型 (DLLM) 的 VSR 框架,将转录制定为具有灵活顺序解码的迭代掩码去噪。通过基于置信度的揭露,DLLM-VSR 尽早提交高置信度位置,并使用提交的token作为双向上下文来完善不明确的位置。为了使 DLLM 适应 VSR,我们引入了一种两阶段掩模去噪训练策略,该策略将视觉到文本内容对齐与长度建模分开。我们进一步观察到预言机长度解码的性能差距,该解码假设可以访问真实的转录本长度,这表明减少目标长度的不确定性可以改善基于 DLLM 的 VSR。为了缩小这一差距,我们开发了长度引导的候选解码,它使用视频持续时间来构建合理的转录长度假设,在多个假设下进行解码,并使用长度合理性和解码置信度对候选重新排序。所提出的方法仅使用其标记的训练数据在 LRS3 上实现了 19.5% 的最先进的 WER。

面向视觉语音识别的扩散大语言模型
图 2:DLLM-VSR 概述。 (a) 具有冻结视觉编码器、长度适配器、FC 投影层和 LoRA 适配的 DLLM 解码器的整体架构。 (b) 基于置信度的揭露,其中首先提交高置信度位置,并将提交的token用作双向文本上下文。 (c) 用于视觉到文本内容对齐和长度感知序列完成的两阶段掩蔽去噪训练。 (d) 具有多个长度假设和联合候选重新排序的长度引导候选解码。