论文
可靠性成反比:幻觉在更大的语言模型中滚雪球速度更快
Reliability Scales Inversely: Hallucinations Snowball Faster in Bigger Language Models
摘要
语言模型越大,可靠性越低。在三个系列、三个基准和六个梯级(包括野外聊天日志)中,扩展将响应开始知识差距缩小到 $7\times$,而响应内知识退化则增加到 $39\times$。我们将该残差追踪到一个变量,即每个位置的分歧 $δ= \log p_M - \log p_O$ 与一个更强的预言机的关系,其二阶矩完全分裂为偏差 $^2$ $\mathrm{KL}(p_M \,\|\, p_O)^2$ 和解码风险 $\mathrm{Var}[δ]$。这种分割在成为统计声明之前是一种可解释性声明:模型的自可读不确定性 $H(p_M)$ 仅输入偏差项,因此风险项没有模型可读组件。风险在平方误差中所占的份额也随着规模的增加而增加,从 $1.7$B 到 $14$B,从 $31\%$ 到 $49\%$。在一次制造中,$H(p_M)$ 在一个词元内放松,而风险持续时间长达 $23\times$,留下一个自信但不稳定的状态,连接连续的制造($+69\%$ at $14$B)。以固定的 $\mathrm{KL}$ 降低该风险可以消除六个梯级和三个家庭中经网络验证的幻觉 $35$-$74\%$。语义熵在该分支上的发射量减少了 $\approx$$30\%$ ($p\!<\!10^{-16}$),尽管它携带了近 $4\times$ 的捏造。更大的模型通过一种占主导地位的、自我延续的、因果性的、对模型本身来说不可见的故障模式,错误会更快地滚雪球。