论文
它向哪个方向移动?视频定向运动失明的诊断和克服-LLM
Which Way Did It Move? Diagnosing and Overcoming Directional Motion Blindness in Video-LLMs
摘要
视频 大语言模型 (Video-LLM) 在时间视频理解方面取得了快速进展,但许多人在基本的感知原语上失败了:有符号的图像平面运动方向。在单个物体向左、向右、向上或向下移动的简单视频中,大多数 Video-LLM 的表现接近偶然,高于偶然的情况很大程度上归因于预测偏差,而不是真正的方向理解。我们将这种故障称为定向运动失明。我们通过 Video-LLM 管道跟踪运动方向信息来定位故障。运动方向仍然可以从视觉编码器、投影仪和 LLM 隐藏状态线性访问,但读出无法将此信号绑定到正确的口头答案选项,从而揭示了方向绑定间隙。尽管合成运动方向指令调整减少了源域上的这种差距,但运动方向概念向量分析表明视觉复杂性削弱了信号幅度并限制了域外泛化。我们引入了 MoDirect,一个用于运动方向指令调整和评估的数据集系列,以及 DeltaDirect,一个诊断驱动的投影仪级目标,可根据相邻帧特征增量预测归一化的二维运动向量。在 MoDirect-SynBench 上,使用 DeltaDirect 进行指令调整将运动方向精度从 25.9% 提高到 85.4%。在 MoDirect-RealBench 上,DeltaDirect 在没有实际调整数据的情况下将实际运动方向精度比普通基线提高了 21.9 个点,同时保留了标准视频理解性能。代码:https://github.com/KHU-VLL/DeltaDirect