论文
EgoErrorVQA:通过自我智能体AI的程序错误评估以自我为中心的理解能力
EgoErrorVQA: Assess Egocentric Comprehension Capabilities through Procedural Errors for Ego-Agentic AI
摘要
我们的大部分日常活动都是程序性的,由一系列相互依赖的步骤组成。然而,视觉代理和视觉语言模型(VLM)的现有基准忽略了从以自我为中心的视觉角度对其程序理解能力的评估,特别是在检测程序错误方面,这是日常协助的关键能力。为了弥补这一差距,首先提出了 EgoErrorVQA 任务,用于通过明确的程序错误建模来进行以自我为中心的程序理解。此外,我们基于 Agent2Agent (A2A) 协议开发了一个用户友好的评估代理,通过基于 VQA 的交互实现对视觉代理的严格和标准化评估。使用开放式问题和多项选择问题对一系列模型进行评估,揭示了处理程序错误和错误类型方面持续存在的弱点。此外,我们还引入了 Ego-ADR,这是一种自适应解耦推理框架,可以解耦复杂的程序推理,以增强模型对程序错误的理解。它在选定的基准上实现了一致的性能增益,并在可比设置下的多个指标上获得了最先进的结果。代码:https://github.com/z1oong/EgoErrorVQA