论文

评估结论的可重复性如何? LLM 推断提示结构的自我审核

How Reproducible Are Evaluation Conclusions? A Self-Audit of LLM-Inferred Prompt Structure

模型评测评测方法与指标

摘要

LLM 系统的评估通常会在小型提示集上进行平均,并将模型报告为排名表。我们询问这样一个表应该有多大的置信度,使用基于 LLM 的提示结构推理作为案例研究:跨五个系列的八个开放模型变体和 8B 到 675B 参数,禁用缓存,保留 293 个原始中间表示。测量的现象一开始就不稳定。相同的调用不能可靠地恢复相同的结构,平均节点集 Jaccard 从 0.39 到 0.96,并且 72% 的提示模型单元从来没有节点集完美。对评估进行审计进一步削弱了其结论,这是我们的主要贡献。在联合集群引导提示下,只有排名的底部是稳定的:两个最不可重现的模型在 99% 和 86% 的重复中保持排名,中间四个模型在 27% 到 48% 中保持排名,前两个模型各在 68% 中,因此该表可靠地识别出最差的模型,但不能可靠地识别出最好的模型。用于合并重复营销活动的两条同样合理的规则改变了八行中的四行,并将研究范围内的标题移动了 7 个百分点。根据真实注释检查推断的结构表明,再现性不能被解读为准确性。八个终点中有四个在测量后十周内被撤回,因此指定的研究无法再进行。因此,小样本大语言模型评估看起来比其证据支持的更明确。我们建议报告排名稳定性、每个细胞的来源、执行的灵敏度比较、每次运行的原始输出以及任何排名的测量日期。