论文
Mr.LHDR:真实多模态长程深度研究Agent基准
Mr.LHDR: A Benchmark for Multimodal Real-World Long-Horizon Deep Research Agents
摘要
深度研究智能体的网络搜索、工具使用、多模态证据分析和信息合成的能力越来越强。然而,现有的基准主要评估中期探索,很少测试智能体是否能够维持长期、依赖重的研究过程。我们介绍 Mr. LHDR(多模态现实世界长视野深度研究),这是一个评估真实世界深度研究的基准,涉及八个类别的长的、不可简化的相互依赖证据链。每个问题均由隐藏的节点关系图构建,平均需要 12.1 个必要的中间结论,平均依赖深度为 10.4,然后才能得出简短、唯一且可验证的答案。问题包含多模态证据,包括图像、地图、PDF、徽标、图表、表格和视频帧,以及至少一个改变推理状态的非文本元素。 LHDR 先生在带注释的依赖关系下评估最终答案和中间结论的正确性。我们使用总体准确性 (OA)、严格准确性 (SA)、检查表分数 (CS) 和依赖性感知检查表分数 (DACS) 来评估通用模型、深度研究系统和智能体框架。结果表明,即使是最强大的系统也只能实现 43.1% OA 和 34.3% SA,这表明最终答案的准确性大大高估了研究的完全成功。删除图像使 DACS 降低 12.6 分,这证明了多模态证据的重要性,而 SA 则随着推理链变长而持续下降。这些发现揭示了持续的、依赖性一致的证据整合,而不是孤立的事实检索,是当前深度研究智能体的关键瓶颈。