论文
大语言贝叶斯不是重新参数化不变的
Large Language Bayes Is Not Reparameterisation-Invariant
摘要
大语言贝叶斯 (LLB) 通过从语言模型中采样候选概率程序、对每个程序运行近似推理,并使用与指数证据界限成比例的权重对它们进行平均来回答非正式建模问题。我们证明这种权重取决于模型的编写方式。对数边际似然对于重新参数化是不变的;证据约束则不然。八所学校的中心项目和非中心项目与 $5.7\times10^{-14}$ 的衡量标准相同,但其权重因 $6.1\times$ 的不同而不同;重要性加权仅将其减少到 $2.2\times$,并且再现 LLB 实际运行的推理(与后验矩匹配的全协方差高斯),仍然在八个学校上留下 $1.9\times$,在 $64$ 维度上留下 $8.9\times$。跨似然族、维度和漏斗严重性,差异达到 $31.9\times$ 并反转符号,因此没有单一的书写方式是一致优选的。它针对八个自然竞争者反转贝叶斯因子,并且模型后验和任何下游目标中的诱发误差由通过已知的锐希尔伯特距离界限的界限缺陷的扩散 $Δ$ 控制。在来自六种语言模型的 $360$ 程序中,编写的参数化范围从 $0\%$ 到 $100\%$ 居中,并且在模型内稳定。在统计上检测等效程序可能会在实际样本预算下错误地合并真正不同的模型;验证我们自己生成的重新参数化不能,并关闭窗口。