论文

LLM 可以写出可靠的评分标准吗?实验再现的元评估

Can LLMs Write Reliable Rubrics? A Meta-Evaluation for Experiment Reproduction

模型评测评测方法与指标

摘要

基于标题的评估是评估基于 LLM 的研究代理的开放式输出的一种有前景的方法,特别是在论文复制方面,直接进行论文与存储库的比较很容易产生幻觉。然而,构建特定于论文的评分标准需要大量的专家努力,从而限制了 PaperBench 等基准测试的可扩展性。在这项工作中,据我们所知,我们首次对 LLM 生成的论文复制标准进行系统元评估。我们将评分细则重新制定为清单式格式,并评估两个骨干模型的四代设置。我们通过语义相似性内在地对生成的评分标准进行元评估,并通过与 真值 评分标准的分数对齐进行外部评估。我们的结果表明,增强的设置极大地改善了下游评估一致性,最强的设置接近人类基线,而内在收益则更为温和。进一步的分析表明,LLM 生成的评分标准通常过于细粒度,偏向于高分,并且不太适应论文领域,凸显了可供性和局限性。