论文
用于视频错误检测的 后训练 VLM
Post-Training VLMs for Video Mistake Detection
摘要
遵循指示时,人为错误是不可避免的,但也可能导致严重后果。因此,人们对开发检测视频错误的方法越来越感兴趣,当前的方法主要集中在封闭集协议上。虽然在受控环境中取得了成功,但封闭集假设限制了其更广泛的适用性,因为任务的任何更改都需要收集新数据和重新训练模型。相反,我们认为错误检测方法应该学习错误的一般概念,而不是过度拟合特定步骤的细节。为了反映这一点,我们引入了错误检测视频问答 (MD-VQA) 协议和随附的基准测试。 MD-VQA 测试方法是否可以辨别步骤是否根据其描述正确执行,无论是可见的操作还是未见的操作。为了应对这一重要挑战,我们提出了第一个用于错误检测的视频语言模型 后训练 技术。我们的方法使用定制的奖励函数来鼓励模型识别指令与相应视频之间的差异。广泛的评估表明,这种方法优于零样本、有监督的 微调 和 后训练 基线。值得注意的是,我们的方法特别适用于未见过的程序,例如,与 EP-VQA 的最佳性能基线相比,提高了 11.6%,为一般错误检测铺平了道路。我们在 https://github.com/FedeSpu/mstk 发布了我们的代码和基准测试。