论文

知道何时弃牌:多阶段中途拒绝实现Token高效的LLM合成数据生成

Know When To Fold 'Em: Token-Efficient LLM Synthetic Data Generation via Multi-Stage In-Flight Rejection

模型训练合成数据

摘要

尽管用大语言模型(LLM)进行合成数据生成在后训练管线中被广泛使用,现有方法通常先完整生成输出再施加质量过滤,导致最终被丢弃的样本浪费大量token。为解决这一问题,我们提出多阶段中途拒绝(Multi-Stage In-Flight Rejection,MSIFR),一个轻量、免训练的框架,在低质量生成轨迹完成之前,于中间检查点检测并终止它们。MSIFR将生成过程分解为顺序阶段,并应用快速的基于规则的验证器来识别算术不一致、幻觉模式与格式违规,从而尽早拒绝有缺陷的样本。我们将中途拒绝形式化为一个序贯决策过程,并证明任何非平凡的丢弃策略都能降低期望token消耗,且拒绝在生成管线中发生得越早,逐阶段节省越多。我们进一步证明条件效用估计构成鞅,确保早期的中途拒绝不会使保留样本的期望效用产生偏差。在五个指令微调模型和七个推理基准上,MSIFR作为独立方法减少11%-77%的token消耗,与早退方法结合时最高减少78.2%,同时保持或提升评估准确率。这些结果证实MSIFR提供了一种在无需额外训练或架构改动的情况下提升基于LLM的合成数据生成效率的实用机制。

知道何时弃牌:多阶段中途拒绝实现Token高效的LLM合成数据生成:论文配图
图 2:用于生成合成数据的 MSIFR 管道。验证器 (V1CLOSE(V_{1}–OPENV3)V_{3}) 在每个阶段过滤低质量的部分生成。三个验证器阶段 (V1–V3) 对应于附录 6.3 中描述的适定执行器 (WPE)、推理跟踪审计器 (RTA) 和解决方案收敛验证器 (SCV)。 GSM8k 跟踪说明了算术或格式错误如何触发早期拒绝,从而防止在最终 LLM 和人工评估之前不必要的令牌支出。