论文
MiRAGE:面向RAG评估的多模态多跳问答数据集生成多智能体框架
MiRAGE: A Multiagent Framework for Generating Multimodal Multihop Question-Answer Dataset for RAG Evaluation
摘要
检索增强生成(RAG)向多模态、高风险企业应用的快速演进,已超过领域特定评估基准的发展。现有数据集往往依赖通用领域语料或纯文本检索,无法捕捉专门技术文档的复杂性——其中信息与多模态不可分割,推理需要综合互不相交的证据。我们通过提出 MiRAGE(Multiagent framework for RAG systems Evaluation)来填补这一空白,它利用专门智能体的协作集群生成经过验证的、领域特定的、多模态、多跳问答数据集。MiRAGE 编排一个专门智能体集群:聚合分散证据的递归上下文优化循环、保证事实依据关联的对抗验证智能体,以及识别专家角色与相关领域以模仿专家认知工作流的智能体。跨四个不同领域(法规、金融、定量生物学与新闻)的大量实证评估表明,MiRAGE 生成的数据集具有显著更高的推理复杂度(平均超过 2.3 跳)与事实忠实性。我们的消融研究指出,若有图像的文本描述可用,MiRAGE 可由 LLM 驱动。视觉依据关联仍是前沿。通过自动化创建反映专有语料潜在主题结构的黄金标准评估数据集,MiRAGE 为严格基准测试下一代信息检索系统提供了必要基础设施。
