论文
VLM 对于零样本程序错误检测的不合理有效性
The Unreasonable Effectiveness of VLMs for Zero-shot Procedural Mistake Detection
摘要
程序错误检测对于许多学科的质量控制和用户帮助非常重要。该领域的最新工作通过使用视频语言模型 (VLM) 的推理功能作为多级管道中的组件,取得了显着的成果,多级管道由用于监督时间动作分割、错误检测和可解释性的单独模块组成。因此,它们仍然依赖于定制的训练数据集,并且需要针对特定任务的训练,从而限制了它们更广泛的适用性。为了解决这个问题,我们引入了零样本程序错误检测,并提出了一个统一的零样本程序错误检测(ZeProM)框架,该框架使用单个预训练的 VLM 联合解决程序错误检测和时间动作分割问题。通过在两个典型错误检测基准(EgoPER 和 CaptainCook4D)上评估我们的框架,我们发现 ZeProM 可以成功执行这些任务,同时接近甚至超越完全监督方法的性能。例如,与最强的监督方法相比,在所有五个 EgoPER 任务中,我们的 EDA 平均提高了 4.4 点,F1@.5 平均提高了 2.0 点。总的来说,我们的结果显示了程序错误检测统一方法的潜力,我们希望这将使该领域远离高度复杂的流程,转向更普遍适用的解决方案。