论文

不可压缩知识探测:通过实际容量估计黑盒 LLM 参数计数

Incompressible Knowledge Probes: Estimating Black-Box LLM Parameter Counts via Factual Capacity

模型评测评测方法与指标

摘要

闭源前沿实验室不公开参数计数。存储 F 个事实至少需要 F/(每个参数的位数)权重,因此事实回忆下限参数计数——一种内在的、与服务无关的信号,尽管(如我们所示)是一个粗糙的信号。我们引入了不可压缩知识探针 (IKP),这是一个涵盖 7 个模糊层的 1,400 个事实问题的基准,旨在隔离无法通过推理导出或无法通过架构改进压缩的知识。我们的得分没有幻觉惩罚(lambda = 0:IKP 准确度只是正确回答的探测事实的分数),这消除了惩罚超参数和每层地板选择;完整的 lambda x 地板消融显示校准在评分选择中是稳健的,而个人估计则不然,从而激发了无惩罚默认值。我们在 19 个供应商的 93 个开放权重模型 (135M-1,600B) 上校准了从 IKP 精度到参数计数的对数线性映射,实现了 R^2 = 0.910;留一法交叉验证证实了泛化(中值倍数误差为 1.48 倍,2 倍内为 72%,3 倍内为 86%)。该工具故意比较粗糙——它的 90% 预测区间在任一方向上跨度约为 3 倍,比推理经济学更宽——因此 IKP 恢复的是数量级的有效容量和相对排名,而不是精确的参数计数。对于混合专家模型,总参数预测知识 (R^2 = 0.67) 比主动参数 (R^2 = 0.41) 更好。我们在精心设计的探针集上评估了来自 27 个供应商的 201 个模型(1,400 个探针中的 1,311 个在名称冲突和标签模糊过滤器中幸存),并将所有主要专有前沿模型的有效知识容量报告为预测带而不是点估计;对于高度安全调整的模型来说,这些是下限,因为拒绝政策可以抑制其他可应对容量的数十个百分点。