论文
VLX-VR:代理感知视频推理模型
VLX-VR: An Agentic-Aware Video Reasoning Model
摘要
现实世界的视频理解需要整合视频中分布的视觉、音频、文本和时间证据。然而,许多管道使用固定的视频上下文和单通道推理,当观察不完整、不明确或相互冲突时,限制了自适应证据获取。我们提出了 VLX-VR,这是一种在由“思考--记忆--观察”循环定义的视频推理框架内进行训练的代理感知视频推理模型。在每个步骤中,VLX-VR 都会确定所需的证据,调用 read_memory 或 write_memory,合并返回的观察结果,并决定是否继续或生成任务输出。我们使用多模态数据(包括视频和代理轨迹)训练 VLX-VR,使用强化学习来学习证据获取、记忆使用和终止。在 MINERVA 上,VLX-VR 在我们比较的模型中实现了最先进的性能,准确率达到 78.79%。在原始三个持续时间组下,其准确率分别为 76.70%、78.73% 和 80.92%,跨持续时间准确度方差为 2.97~$\mathrm{pp}^2$。在正确回答的样本上,VLX-VR 96.20% 的推理痕迹与 MINERVA 参考推理痕迹及其描述的证据一致,而所有评估样本中大约 75.80% 既满足答案正确性又满足这种基于证据的痕迹标准。这些结果显示出在整个持续时间内的强大性能和大致稳定的行为,而计数、状态变化、因果推理和空间感知仍然具有挑战性。