论文

通过迭代奖励引导自我改进表格语言模型 后训练

Self-Improving Tabular Language Models via Iterative Reward-Guided Post-Training

模型训练偏好优化

摘要

表格语言模型可以通过将行建模为标记序列来生成合成表,但它们通常使用受监督的 微调 进行一次训练,然后用作静态合成器。这是有限制的,因为下一个标记的可能性不会直接优化用于评估合成数据的分布、效用和不可区分性属性。我们通过生成-得分-对齐协议研究表格语言模型的迭代奖励引导的 后训练,其中生成器对合成行进行采样,任务指定的奖励对它们进行排名,并且模型相对于固定的监督参考进行更新。在此协议中,我们提出 \textbf{TabGRAA} (\textbf{Tab}ular \textbf{G}roup-\textbf{R}elative \textbf{A}dvantage \textbf{A}lignment),这是一种组相对对齐方法,使用组平均策略/参考对数比而不是一对一的偏好对来比较高和低奖励生成的组。在五个混合类型基准中,TabGRAA 改进了 GReaT 骨干网,超越了额外监督的 微调,并在保真度和下游效用方面实现了改编的 DPO、KTO 和 NPO 基线之间最强的平均权衡,同时保持了接近监督基线的经验隐私诊断。消融表明,收益取决于有意义的奖励排名和稳定的群体级别更新,而不仅仅是额外的训练。奖励替代和记分器分离研究进一步表明,后训练 循环可以使用基于分类器和无分类器的奖励,并且适当的记分器分离对于保持保真度-实用性-隐私权衡非常重要。这些结果将 TabGRAA 定位为一种用于表格语言模型生成器的自我改进的 后训练 方法,是对强大的静态表格合成器的补充。