论文

EgoBench:面向工具使用代理的交互式第一视角多模态基准

EgoBench: An Interactive Egocentric Multimodal Benchmark for Tool-Using Agents

智能体系统Agent任务评测

摘要

随着 AI 代理越来越多地在开放的真实环境中运行,它们需要多模态感知、带多跳推理的工具调用以及与用户动态交互之间的深度协同。然而,现有基准未能联合评估这些能力,原因在于设计严格耦合的多能力任务、模拟自然且受任务约束的用户反馈,以及确保动态交互的客观评估都存在挑战。为弥合这一差距,我们引入 EgoBench,首个面向工具使用代理的交互式多模态基准。EgoBench 包含 1,045 个以第一视角视频为基础的任务,覆盖四个日常场景,并配有用于评估的用户-代理-工具交互环境。我们实现了一个三阶段协同流水线,每个任务都据此设计,以强制联合应用视觉感知与工具增强的多跳推理。我们还在 EgoBench 中开发了多代理模拟用户来评估代理的交互能力,它能为代理生成高保真、与任务对齐的响应。此外,我们建立了确定性的联合验证框架,通过基于过程和基于结果的等价性保证客观评估。在 EgoBench 上对八个 SOTA 视频-MLLM 代理的基准测试揭示出严重的性能天花板:最好的模型在表现最好的场景中也只达到 30.62% 的准确率,四个场景平均 19.43%。最后,我们进行多维错误分析以解耦失效模式,揭示推进未来 AI 代理的能力瓶颈。

EgoBench:面向工具使用代理的交互式第一视角多模态基准:论文配图
图 1:示例 EgoBench 任务的说明性交互过程。它演示了评估代理和模拟用户之间的动态交互,包括工具调用。交互内容中的不同背景颜色突出了任务设计的不同方面,说明了我们的基准如何综合评估多模态感知、多步骤推理、工具使用和交互能力。