论文

DeepSurvey-Bench:评估自动生成的科学调查的学术价值

DeepSurvey-Bench: Evaluating Academic Value of Automatically Generated Scientific Survey

模型评测基准与评测资源

摘要

自动化科学调查生成技术的快速发展使得建立一个全面的基准来评估生成的调查的质量变得越来越重要。几乎所有现有的评估基准都依赖于有缺陷的选择标准(例如引用计数和结构一致性)来选择人工编写的调查作为地面实况调查数据集,然后使用结构质量和参考相关性等表面指标来评估生成的调查。然而,这些基准有两个关键问题:(1)地面实况调查数据集由于缺乏数据而不可靠。学术维度注释; (2)评价指标只关注调查的表面质量,如逻辑连贯性。这两个问题都导致现有的基准无法评估其深层的“学术价值”,例如核心研究目标和不同研究的批判性分析。为了解决上述问题,我们提出了 DeepSurvey-Bench,这是一种新颖的基准,旨在综合评估生成的调查的学术价值。具体来说,我们的基准提出了一个全面的学术价值评估标准,涵盖三个维度:信息价值、学术传播价值和研究指导价值。基于这个标准,我们构建了一个带有学术价值注释的可靠数据集,并评估了生成的调查的深层学术价值。大量的实验结果表明,我们的基准与人类在评估生成的调查的学术价值方面的表现高度一致。

DeepSurvey-Bench:评估自动生成科学综述的学术价值
图1:现有评估框架与我们提出的 DeepSurvey-Bench 的比较。