论文

SurveyReview:调查评估者与审阅者一致的基准

SurveyReview: A Reviewer-Aligned Benchmark for Survey Evaluators

模型评测基准与评测资源

摘要

大语言模型 的快速发展已将调查撰写从长达数月的手动工作转变为自动化过程。随着世代规模的扩大,可靠的评估成为瓶颈,LLM 越来越多地用作调查评估器。然而,现有的方法在很大程度上依赖于现成的 LLM 作为法官的方法,没有与人类评审员进行系统的一致性,并且仍然缺乏量化与人类评审员的一致性的系统框架。为了解决这一差距,我们提出了 SurveyReview,这是一个与审稿人一致的、用于调查评估的多维基准和数据集。我们收集并注释了 675 份调查论文和 1,630 份评论报告。我们通过将自由形式的评论转换为四维分数(可读性、批判性、综合性、结构)并搭配支持理由来构建真实的同行评审报告。我们进一步发布了标准化的训练/测试分割和评估协议,以衡量自动评估者和人工审查者之间的一致性。为了验证基准,我们开发了 SurveyAlign,这是一个强大的基线评估器,由 微调 Qwen3-32B 和 LoRA 在我们的注释数据上进行,并通过知识密集型维度的外部知识进行了增强。在测试集上,与使用 GPT-5.2 基于提示的判断相比,SurveyAlign 显着提高了审稿人的一致性,将所有四个维度的平均 MSE 从 2.28 降低到 1.38,将 MAE 从 1.15 降低到 0.69。我们的贡献有两个:(1)我们建立了第一个多维、与审稿人一致的数据集,并具有用于调查审阅的可重复评估框架; (2)我们开发了一个强大的基线评估器,可以大大提高与人类评审员的一致性,为未来的研究提供有竞争力的参考。我们的代码和数据可在 https://surveyreview.github.io 获取