论文

用于手语翻译的注意力引导视觉语言模型

Attention-Steered Vision-Language Models for Sign Language Translation

模型训练强化学习

摘要

视觉语言模型 (VLM) 已成为多模式视频理解的强大框架。然而,它们在手语翻译任务中仍然受到限制,我们发现现有基于 VLM 的翻译器的一个关键失败模式:时空视觉基础差。特别是,我们发现标准的下一个词元交叉熵并不直接提供模型应该参加的地点和时间的信号,导致模型忽略与符号相关的区域和框架。为了应对这一挑战,我们提出了 AttnSign,一种基于 VLM 的时空注意力引导框架,用于手语翻译。 AttnSign 首先在每一帧中引入对标志相关区域(例如面部和手部)的空间注意监督;然后开发一种基于强化学习的运动节奏转向方法,鼓励模型探索并专注于符号级关键帧。 How2Sign 和 OpenASL 基准测试的实验结果表明,我们提出的 AttnSign 始终优于现有方法。