论文
平板工作台:通过家具组装评估大型视觉语言模型的时空理解
Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly
摘要
大视觉语言模型(LVLM)的出现显着提高了视频理解能力。然而,现有的基准主要关注粗粒度任务,例如动作分割、分类、字幕和检索。此外,这些基准通常依赖于可以轻松口头识别的实体,例如家用物品、动物、人类主体等,限制了它们对复杂的野外视频场景的适用性。但是,许多应用(例如家具组装、烹饪等)需要对视频进行逐步的细粒度时空理解,而当前的基准测试对此没有进行充分的评估。为了解决这一差距,我们推出了 Flat-Pack Bench,这是一种以家具组装任务为中心的新颖基准。我们的基准测试在细致入微的任务上评估 LVLM,包括装配动作的时间顺序、装配状态的时间定位、理解零件配合和跟踪,使用多项选择问题与突出显示相关零件的视觉提示作为细粒度问题的参考。我们的实验表明,最先进的 LVLM 在细粒度时空推理方面存在很大困难,凸显了它们在有效利用视频中的时间信息、有限的跟踪能力以及对物理接触等空间交互的理解方面的局限性。