论文
DIAG:数据高效数学偏好的诊断迭代对齐和生成 蒸馏
DIAG: Diagnostic Iterative Alignment and Generation for Data-Efficient Mathematical Preference Distillation
摘要
迭代偏好优化对于在数学推理任务上调整 大语言模型 至关重要,但其效率常常受到信号稀缺的限制:随着模型的改进,静态问题集与模型不断发展的能力越来越不匹配,产生要么太容易要么太难,因此缺乏信息,从而导致有效偏好对的稀缺。我们提出了 DIAG,一种诊断迭代对齐和生成框架,可自适应地重塑实践分布,以增加信息监督并在学生当前能力边界附近集中训练。 DIAG 包括两个阶段:(1)诊断有效的偏好对收益率,以校准探索-利用权衡,并通过经验贝叶斯收缩估计器分配主题配额,从而优先考虑高收益概念; (2) 进行有针对性的练习,教师根据学生的失败痕迹综合各种变体。我们进一步提供了一种理论观点,将 DIAG 解释为教师介导的对实践分布的 KL 正则化重新加权的近似,以达到学生的能力边界,其中有效偏好对产量最大化。实验表明,DIAG 提高了迭代的产量,并在等有效的训练预算下提供了更强的推理性能,这表明它可以为数学推理提炼出更多信息丰富的偏好监督。