论文

生成器访问在自回归中的作用 后训练

The Role of Generator Access in Autoregressive Post-Training

模型训练强化学习

摘要

我们研究生成器访问如何约束自回归 后训练。核心问题是学习者是否仅限于从根节点重新开始的采样轨迹,或者可以返回到先前构建的前缀并查询那里的下一个词元规则。在 root-start 机制中,输出采样、生成词元日志概率、top-$k$ 报告以及沿采样轨迹的完整下一个词元分布都减少为一个规范实验,受到达到信息前缀的 同策略 概率的限制。弱前缀控制打破了这一障碍,一旦控制可用,更丰富的观察(例如条件采样或 logits)可以优于 top-$1$ 访问。仅更改生成器接口会为 KL 正则化结果奖励 后训练 带来指数差距。