论文
LLM-Metrics:通过 大语言模型 记忆衡量研究影响
LLM-Metrics: Measuring Research Impact Through Large Language Model Memory
摘要
引用计数仍然是评估研究影响的主要指标,但它们受到有据可查的限制:时间滞后、学科偏见和马太效应。在这里,我们提出了 LLM-Metrics,这是一种源自 大语言模型 (LLM) 参数记忆的研究影响评估指标。中心假设是,高影响力的论文在学术界获得更多的曝光,这种曝光以文本形式进入 LLM 训练数据,模型因此对这些论文形成更强的参数记忆。我们设计了四种类型的多项选择探针,涵盖标题识别、作者识别、方法识别和地点识别,并评估了 6 个供应商的 17 个 LLM 中 2023-2024 年发表的 549 篇计算机科学论文,涵盖了 0.5B 到 72B 的参数。在 17 个模型中,15 个产生了阳性预测,其中 9 个在 p 小于 0.05 时显着,相对于引用计数的整体 Spearman 相关性为 rho = 0.1495 和 p = 0.0004。另外三个发现支持了拟议的机制。首先,2024 篇论文的预测信号更强,rho = 0.1880,其引用计数在模型训练时接近于零,降低了简单反向因果解释的合理性。其次,作者识别探针表现出最强的辨别力,与曝光驱动的记忆机制一致。第三,模型规模和预测能力是非单调的:3B 参数模型 Llama-3.2-3B-Instruct,rho = 0.1829,优于大多数较大的模型,支持选择性记忆假设,其中较小模型的有限容量可以充当有效的信息过滤器。 LLM-Metrics 为研究评估提供了实时、跨学科、独立于引文的范式。