论文
LitReview Arena:用对战式同行评审平台评估文献综述智能体
LitReview Arena: Evaluating Literature Review Agents with Battle-Style Peer Review Platform
摘要
文献综述对科学进步至关重要,但严格评估自动生成的综述仍然困难,因为研究效用的许多方面依赖专家判断而非参考重叠类指标。我们提出LitReview Arena,一个对战式评估平台,配有为文献综述质量定制的结构化协议:具有AI论文写作经验的领域专家比较匿名化的草稿,被匹配到其专长领域的话题,并按五项文献综述专属标准给出逐维度结果。通过该协议,我们收集了约3千条专家判断,每条包含五个维度的结果,并显示即使最强的现有系统在总体效用上对人类草稿的决定性对局中胜率也仅为23.0%,而Sonar Deep Research等智能体型LLM大幅超越基础语言模型60%以上。我们进一步发现,现有LLM-as-a-judge方法与人类专家明显不对齐(Spearman rho=0.467),尤其是在论文结构和研究建议这类综合密集型标准上。利用收集的偏好数据,我们提供了专家校准的评估器LitJudge,把对齐度提升到Spearman rho=0.78,与专家间一致性相当;代码与数据已在 https://github.com/VanellopeAsher/LitReview-Arena 公开。
