论文
学习对视频描述链排序以实现视频文本对齐
Learning to Rank Caption Chains for Video-Text Alignment
摘要
直接偏好优化 (DPO) 是一种有效的技术,可训练语言模型以生成偏好而非偏好的响应。然而,这种二元“赢家通吃”的方法对于视觉语言模型来说并不是最优的,因为视觉语言模型的响应质量高度依赖于视觉内容。特别是,即使响应不如替代方案优选,它仍然可能忠实于视觉输入。标准的 Bradley-Terry DPO 公式缺乏这种细微差别,增加了获胜响应的权重,而没有充分考虑“失败”响应是否仍然保持高视觉保真度。在这项工作中,我们研究了排名优化作为替代方案,更准确地将响应的 忠实性 定位到视觉输入。我们专注于使用详细视频字幕的视频文本对齐,提出了一种通过重复字幕降级大规模生成具有挑战性的、完全有序的视频描述链的方法。我们的结果表明,在长格式内容生成和评估方面,排名优化优于二进制 DPO,而且重要的是,我们发现这些方法需要对视觉编码器进行微调才能有效,这挑战了 DPO 作为纯粹的语言重新加权过程的观点。