论文
LLM后训练该比较哪些对?
Which Pairs to Compare for LLM Post-Training?
摘要
基于偏好的后训练已成为对齐语言模型的核心范式。常见的数据收集策略是为每个提示生成少量补全——并为所得比较对打标。但人类偏好标签常远贵于生成更多补全——提示同一标注预算应有不同用法:生成更大的补全池——但只标注信息量最大的比较对。本文研究偏好后训练中应比较哪些对。我们把比较策展形式化为抽样设计问题——并以偏好后训练目标下最终策略的质量评估各设计。我们为直接偏好优化(DPO)实例化该框架——分析标注对的选择如何经DPO训练传播到下游策略性能。我们的主要结果给出DPO训练策略后训练最优性差距的匹配上下界。界表明比较选择经单一设计依赖的信息矩阵影响下游性能——该矩阵把标签分配与参数估计误差及策略次优性联系起来。这为预算约束的比较策展给出显式优化准则——并推动从大型生成补全池选择信息对的实用抽样设计。合成设定与语言模型后训练基准上的实验表明所提设计持续改进样本效率——超越常见比较选择启发式。
