论文

贝叶斯微调产生的语言模型与他们的信念允许的贝叶斯一样

Bayesian Fine-tuning Yields Language Models that are as Bayesian as their Beliefs Allow

模型训练监督微调与指令调优

摘要

语言模型 (LM) 越来越多地用于需要从一些观察中推理隐藏变量的任务,贝叶斯推理是规范上正确的解决方案。虽然对最优 $Bayesian$ 模型的输出进行 LM 的监督微调会产生接近贝叶斯的行为,但对任务的真实答案进行标准监督微调 (SFT) 却达不到这一效果。但行为本身并不能告诉我们 $why$ 在 $Bayesian$ 或 $oracle$(真实答案)信号上的调整有所不同:产生的 LM 是否代表贝叶斯信念、对它们起作用,或者按照贝叶斯规则将它们转变为选择。为了比较它们,我们对 LM 制定了越来越严格的要求,将其视为贝叶斯决策者,涵盖其行为、表示和计算,并在航班推荐任务上对其进行测试。贝叶斯训练的 LM 表现出贝叶斯性质,在其中间层对贝叶斯规则的数量进行编码,并在一定程度上使用编码的信念进行推荐。经过预言机训练的 LM 与它的不同之处在于它所持有的信念以及是否将信念读取为建议。 LM 之间交换信念会转移贝叶斯优势的一部分。因此,贝叶斯微调在 LM 中安装了可用的贝叶斯信念,以便在不确定性下进行推理,而预言机答案上的标准 SFT 则无法做到这一点,这凸显了细致入微的监督的优势。