ERRORQUAKE:开放权重 大语言模型 中的重尾错误严重性分布
ERRORQUAKE: Heavy-Tailed Error Severity Distributions in Open-Weight Large Language Models
摘要
在匹配精度下,开放权重 LLM 的错误严重性分布形状有很大不同——这种差异对于标量错误率来说是不可见的。幻觉基准报告单个错误计数,并将所有错误视为同等,但错误的日期和捏造的法院裁决存在数量级的差异。我们引入了 Errorquake-10k,这是一个 10,000 条查询的基准测试,对 8 个领域和 5 个难度等级的连续 0-4 严重性等级上的每个响应进行评分,并且我们对 21 个开放权重模型的每个模型严重性分布进行拟合。对于每个模型,我们估计具有 95% bootstrap 置信区间的严重性分布指数(b,Gutenberg-Richter 上尾斜率)。标题:在 210 个模型对中,85 个模型对在人类共识评分上具有不相交的 95% b 置信区间(|Delta epsilon| < 0.05),例如deepseek-v3.2 与 ministral-14b 的对比,epsilon = 0.586,Delta b = 0.47。一项包含 519 项三人评估者的人类验证研究确认了测量可靠性 (ICC(2,k=3) = 0.85),验证了 LLM 法官排名 (rho = 0.89),并确认了人类数据的密集模型缩放相关性 (rho_s = -0.86)。我们证明了一个不可约性定理,表明严重性概况和错误率在信息上是非冗余的(I(b; 模型 | epsilon) = 1.56 位;64.5% 的跨模型 b 方差无法由 epsilon 解释)。严重性机制分类(kappa = 0.83)表明错误类型随严重性发生明显变化:低严重性错误是检索(71%);高严重性错误是捏造的 (39%),并且这种构成因模型大小而异 (p < 0.0001)。严重性分布应与准确性一起报告;它携带错误率无法携带的区分信息。