论文

MiroEval:从过程与结果评测多模态深度研究智能体

MiroEval: Benchmarking Multimodal Deep Research Agents in Process and Outcome

智能体系统Agent任务评测

摘要

深度研究系统近期的进展令人瞩目,但评估仍落后于真实用户需求。现有基准大多使用固定评分细则评估最终报告,未能评估其背后的研究过程。大多数基准的多模态覆盖有限,依赖无法反映真实查询复杂度的合成任务,且无法随知识演进进行更新。为弥补这些缺口,我们提出 MiroEval,一个面向深度研究系统的基准与评估框架。该基准包含100个任务(70个纯文本、30个多模态),全部植根于真实用户需求,并通过支持周期性更新的双路径流水线构建,从而形成动态演进的评测环境。所提出的评估套件从三个互补维度评估深度研究系统:使用任务专属评分细则的自适应综合质量评估、通过主动检索与推理对网页来源和多模态附件进行核验的智能体事实性验证,以及审计系统在整个研究过程中如何检索、推理与改进的以过程为中心的评估。对13个系统的评估得出三项主要发现:三个评估维度捕捉到系统能力的互补侧面,各自揭示出不同系统独特的优势与短板;过程质量可作为总体结果的可靠预测指标,同时能暴露输出级指标无法察觉的弱点;多模态任务带来显著更大的挑战,大多数系统的得分下降3至10分。MiroThinker 系列取得最均衡的表现,其中 MiroThinker-H1 在两种设置下均名列总体第一。人工核验与鲁棒性结果证实了该基准与评估框架的可靠性。MiroEval 为下一代深度研究智能体提供了一个整体性的诊断工具。

MiroEval:从过程与结果评测多模态深度研究智能体:论文配图
图1:各模型在70个纯文本深度研究任务上的性能对比,从三个维度衡量MiroEval中的过程与结果表现。