论文

LARK:基于可学习性的轨迹选择,实现高效推理 蒸馏

LARK: Learnability-Grounded Trajectory Selection for Efficient Reasoning Distillation

模型训练合成数据

摘要

我们研究推理 蒸馏 的轨迹选择,其中教师生成的推理轨迹被选择性地用作学生模型的监督。现有的方法依赖于轨迹质量或模型置信度等启发式方法,但它们经常忽视轨迹是否可以被学生学习。在本文中,我们提出了 LARK,一种基于可学习性的推理轨迹选择方法。 LARK 选择学生可以有效学习的轨迹,同时保留完整训练分布的泛化性。 LARK 的核心是可学习性因子 $ρ$,它表征了学生训练损失减少的速率。为了有效地估计这个速率并保持泛化性,我们引入了可学习性代理和 $χ^2$ 正则化选择策略,以平衡可学习性和分布覆盖范围,两者都对其估计误差提供了强有力的理论保证。根据经验,LARK 在多个基本模型和推理任务中始终优于数据选择基线。诊断分析表明,LARK 分数可以预测下游训练效用,并且 LARK 选择的轨迹可以更快地减少监督 微调 损失。我们的代码可在 https://github.com/Tianrun-Yu/LARK 获取。