论文
从贝叶斯视角统一ICL、SFT与KL正则化强化学习
Unifying ICL, SFT, KL-Regularized RL Through a Bayesian Lens
摘要
大型语言模型现在在多种范式下进行训练和评估:监督微调(SFT)、少样本上下文学习(ICL)、KL 正则化 RLHF/RLVR、同策略蒸馏(OPD)以及使用搜索和思维链的测试时推理。这些方法经常被认为是根本不同的,而最近的实证结果(例如少样本提示对 RL 调整的推理模型的混合影响)可能显得令人费解。本说明提出了贝叶斯观点,将这些过程置于同一基础上。核心是一个两步模板:(i)使用先验/参考模型和效用信号(对数似然、奖励或优势),在给定上下文的输出或动作上构建(广义)贝叶斯或吉布斯后验 q*; (ii) 通过权重 (SFT/RL) 或上下文 (ICL) 中的参数族上的正向 KL 投影来近似 q*。第一部分将小样本 ICL 和 SFT 形式化为贝叶斯后验预测的摊销和权重投影。第 II-IV 部分表明,KL 正则化 RLHF/RLVR、奖励加权 SFT、奖励加权 ICL (RW-ICL) 和优势加权 SFT (AWSFT) 都是由奖励或优势引起的前向 KL 投影到后验的实例。我们理清这些等价在哪里成立(目标和一阶更新)以及在哪里不成立(学习信号的来源和粒度)。第五部分概述了对现代推理流程的影响:RLHF/RLVR 配方为“后验设计 + 投影”,为什么冷启动或监督预热对于重要性加权 KL 投影实际上是不可避免的,以及将测试时贝叶斯搜索与训练时 KL 摊销相结合的 DeepSeek-R1 和 o1 式推理模型。