论文

引用核验一定需要前沿模型吗?深度研究来源归因的LLM评审基准

Do You Need a Frontier Model as a Citation Verifier? Benchmarking Rubric LLMs for Deep-Research Source Attribution

模型评测模型能力评测

摘要

强化学习越来越依赖LLM评审器对评分标准的每个条目进行评价,评审器在训练中充当奖励模型。研究针对深度研究系统的引用质量,检验评审器需要多强的能力,以及存在哪些偏差。引用质量按来源相关性与事实支持两个维度评价每个归因与引用配对。在对抗性长文基准中,三个模型家族的八个现成LLM评审器与1,248项标准标签判断比较;全部标签经人工复核,其中378项为评审分歧后裁决的疑难例。较便宜的评审器在两个维度仍有竞争力。GPT-5-mini的来源相关性通过类别F1最高,为0.908,κ=0.636;事实支持维度的置信区间重叠,模型差异无统计显著性,没有单一模型占优。即便F1相近,评审器的通过率偏移、假阳性率与假阴性率仍明显不同。单一F1掩盖这种方向性偏差,而强化学习会强化评审器提供的信号。因此,把引用评分标准用于奖励前应校准评审器,此校准并不需要最昂贵模型。