论文
基于代理的测试时间对齐的拒绝准则
On the Rejection Criterion for Proxy-based Test-time Alignment
摘要
最近的工作提出了测试时对齐方法,该方法依赖于一个小的对齐模型作为代理,指导生成更大的基础(未对齐)模型。隐式奖励方法会扭曲大型模型分布,而当大型基础模型对其结果缺乏信心时,助推方法会将下一个标记的生成推迟到小型对齐模型。在这项工作中,我们首先证明这两种方法都可以简化为从类似的图形模型中采样,它们仅在拒绝标准(或分布)的定义上有所不同。此外,我们认为,由于诸如措辞歧义之类的语言现象,置信标准是没有动机的。我们提出了一种基于保守置信度赌注的新颖拒绝标准。通过实验,我们的新颖方法在多个数据集上优于之前的工作。