论文
超越二元偏好:肢体运动字幕的分级偏好优化
Beyond Binary Preferences: Graded Preference Optimization for Limb-Motion Captioning
摘要
视觉语言模型 (VLM) 可以生成丰富的视频字幕,但经常会错误地识别执行动作的人或涉及哪个肢体,尤其是在镜头切换时。改进这些细节需要进行评估和训练,以区分丢失的信息和错误的断言。我们推出了 FlexBench,这是一个涵盖 3,105 个镜头和 18,161 个评估查询的基准,具有经过人类验证的身份以及对细粒度肢体动作和状态的系统化的每人覆盖。其源自参考的清单支持对人物和镜头上下文中的完整字幕进行自动评估。我们的物理对齐分级分数 (GPA) 对正确的内容给予奖励,对不正确或捏造的行为扣分,使这些错误在总分中明确体现。在此基础上,我们提出了分级边际直接偏好优化(GM-DPO),它为更严重的动作错误分配更强的偏好边际和更大的训练权重。在三个 VLM 主干中,GM-DPO 在评估的偏好目标中实现了最高的实质性行动和 GPA 分数,比 DPO 提高了 2.02-3.40 分。在Qwen3-8B上,相对于DPO,加权幻觉率降低了21.3%。这些进步伴随着持续的长篇输出、改进的镜头结构以及在另外三个多模态基准上的竞争表现。