论文

HiEviDR-Bench:深度研究中分层证据聚合的基准

HiEviDR-Bench: A Benchmark for Hierarchical Evidence Aggregation in Deep Research

模型评测基准与评测资源

摘要

深入研究需要模型从大规模异构源检索、连接和合成证据,以回答复杂的查询并生成分析报告。现有的基准主要评估最终结果,例如答案正确性、报告质量或引文对齐,同时对证据是否正确选择、链接和聚合成支持的主张和结论提供有限的可见性。为了解决这一差距,我们引入了 HiEviDR-Bench,这是一个评估深度研究中分层证据聚合的基准。 HiEviDR-Bench 涵盖纯文本和多模式条件下的开放域和学术域设置,并用明确的证据图表示每个实例,该证据图捕获证据选择、跨源链接以及从证据到中间主张和最终结论的聚合。在此基础上,我们开发了一个面向可追溯性的评估框架,具有五个维度:报告质量、证据可追溯性、引用准确性、声明验证和答案正确性,以及用于细粒度错误定位的渐进门控机制。 HiEviDR-Bench 包含 2,000 个经过人工验证的问题,以及多个难度级别的证据图。对 16 个代表性多模态 大语言模型 的实验表明,尽管许多系统实现了很强的报告质量,但它们在引文准确性、权利要求构建和答案正确性方面的性能显着下降。进一步分析表明,主要瓶颈在于证据识别和中间主张构建,这表明表面报告质量高并不一定意味着在我们的基准上有扎实的多阶段推理。