论文

是什么证明你错了:对可证伪研究构想的语言模型进行基准测试

What Proves You Wrong: Benchmarking Language Models on Falsifiable Research Ideation

模型评测基准与评测资源

摘要

大语言模型 越来越多地用于提出研究想法,但判断这些想法的主流方法没有提供共同的决策规则:自由形式的判断随风格和立场而变化,并根据后来的论文进行评分,奖励恢复一个已实现的轨迹。我们引入了一个基准,其中包含从文献到测试的提案:Lit2Test基准以围绕伪造结果组织的六场合同为中心,因此每个提案都预先承诺了将证明其错误的观察,使其质量首先是可判定的,而不仅仅是可争论的。 Lit2Test 根据 200 个真实纸质邻域前瞻性构建,从四个前沿模型中引出建议,并通过 1,200 个在两种演示顺序中盲判的成对比较进行比较。该协议通过诊断控制和有限的人类校准来审核其自身的可靠性,并由三名注释者在明确规定的可靠性范围内证实结论。 Lit2Test 在所有 10,000 个引导程序重复中恢复了四个模型的严格排名,并且分离来自于所提出的测试和指标的质量,而不是表面的流畅性。我们发布基准、构建管道和审计工件以供公众使用。