论文
ResearchQA:科学论文引文问答的基准测试
ResearchQA: Benchmarking Citation-Grounded Question-Answering on Scientific Papers
摘要
大语言模型 越来越多地用于辅助科学阅读,但现有的评估方法往往无法检测答案是否得到可验证引用的支持。我们引入了 ResearchQA,这是一个由来自 494 篇开放获取论文的 6,211 个单论文问答对组成的基准,涵盖八个领域和四种问题类型:查找、理解、多跳和对抗性。 ResearchQA 专为基于引文的评估而设计:它允许为某个主张提供多个有效的支持段落,并在源论文不支持答案时奖励基于拒绝的拒绝。我们使用确定性引文匹配器和基于 LLM 的评估器,在基于引文的论文聊天设置中评估了八个领先的封闭式和开放式权重模型。基于引文的指标比 LLM 评估器分数更清楚地区分系统:不同模型的章节覆盖率和引文准确性差异很大,而评估器分数仍然紧密压缩。我们进一步发现,开放权重模型接近最佳的封闭模型引用准确性,同时每个示例的延迟降低了 3 到 6 倍。我们发布基准、评估工具和评估提示。