论文

EgoCoT-Bench:针对 MLLM 的基于且可验证的以操作为中心的思维推理链基准测试

EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs

模型评测基准与评测资源

摘要

多模态 大语言模型 (MLLM) 的快速发展引发了人们对以自我为中心的视频理解的兴趣日益增长,特别是 MLLM 识别细粒度的手部对象交互、跟踪对象状态随时间变化以及从第一人称视角推理动态环境中的操作过程的能力。然而,现有的以自我为中心的视频基准受到 \textbf{有限的有根据的基本原理评估}的影响,为以操作为中心的细粒度推理提供有限的支持,并且很少检查模型基本原理是否基于明确的时空证据。为了解决这一差距,我们引入了 \textbf{EgoCoT-Bench},这是一个细粒度的以自我为中心的基准,用于基于和可验证的以操作为中心的推理,并具有明确的分步基本原理注释。总体而言,EgoCoT-Bench 在 351 个以自我为中心的视频中包含 3,172 个可验证的 QA 对,分为四个任务组,总共 12 个子任务组,涵盖感知和回顾、预期和高级推理。该基准是通过时空场景图(STSG)引导生成框架构建的,并由人类注释者进一步细化,以确保正确性、以自我为中心的相关性和细粒度的质量。实验结果表明,以自我为中心的细粒度推理仍然存在困难,并进一步表明,许多多模态模型产生的解释是答案正确的,但有与答案不一致的证据。我们希望 EgoCoT-Bench 能够作为一个有用的测试平台,在以自我为中心的视频理解中进行基础且可验证的推理。项目页面和补充材料可在以下网址获取:https://dstardust.github.io/EgoCoT/。