论文

SignDPO:基于骨架的无光泽手语翻译的多级直接偏好优化

SignDPO: Multi-level Direct Preference Optimisation for Skeleton-based Gloss-free Sign Language Translation

模型训练偏好优化

摘要

我们提出了 SignDPO,这是一种新颖的多级直接偏好优化 (DPO) 框架,旨在增强基于骨架的手语翻译的一致性。虽然当前基于骨架的模型在使用最大似然估计方面取得了重大进展,但它们主要受到基于模仿的范式的限制,该范式缺乏对手语的细粒度时空细微差别的区分敏感性,常常导致语义漂移。为了解决这个问题,SignDPO 将优化目标从简单的序列模仿转变为跨空间、时间和语言维度的结构化偏好对齐。我们的框架涉及三个关键设计。首先,我们引入了一种分层扰动策略,以自动在全局和局部粒度上构建空间和时间非首选样本。其次,我们提出了一种自我引导机制,利用解码器交叉注意力分数来识别和扰乱语义上显着的骨骼区域,迫使模型区分真正的符号信号和结构扭曲。第三,我们通过 微调 专用扰动模型建立了一个自动化的语言级偏好生成器,无需手动注释即可捕获复杂的输出级故障模式。对三个广泛采用的基准(CSL-Daily、How2Sign 和 OpenASL)进行的大量实验表明,SignDPO 始终优于最先进的无光泽方法,甚至可以与已建立的基于光泽的方法相媲美。我们的结果表明,多级偏好对齐是弥合高熵骨架轨迹和离散语言语义之间差距的强大范例。