论文

可预测的虚构:LLM 的事实回忆随模型大小和主题频率而变化

Predictable Confabulations: Factual Recall by LLMs Scales with Model Size and Topic Frequency

模型评测模型能力评测

摘要

虽然缩放法则控制 大语言模型 的总体性能,但没有缩放法则将事实回忆与模型大小和训练数据组成联系起来。我们评估了由自动参考验证系统评估的 8,900 多篇学术参考文献中的 38 个模型。召回质量遵循模型参数计数和训练数据中主题表示的对数线性组合中的 sigmoid 曲线。仅这两个变量就解释了来自四个家族的 16 个密集模型中 60% 的方差,在单个家族中上升到 74-94%。该形式与受叠加启发的帐户相匹配,其中召回率由信噪比控制:信号强度与概念频率成比例,本底噪声与模型容量成比例。