论文
知道何时弃牌:多阶段中途拒绝实现Token高效的LLM合成数据生成
Know When To Fold 'Em: Token-Efficient LLM Synthetic Data Generation via Multi-Stage In-Flight Rejection
摘要
尽管用大语言模型(LLM)进行合成数据生成在后训练管线中被广泛使用,现有方法通常先完整生成输出再施加质量过滤,导致最终被丢弃的样本浪费大量token。为解决这一问题,我们提出多阶段中途拒绝(Multi-Stage In-Flight Rejection,MSIFR),一个轻量、免训练的框架,在低质量生成轨迹完成之前,于中间检查点检测并终止它们。MSIFR将生成过程分解为顺序阶段,并应用快速的基于规则的验证器来识别算术不一致、幻觉模式与格式违规,从而尽早拒绝有缺陷的样本。我们将中途拒绝形式化为一个序贯决策过程,并证明任何非平凡的丢弃策略都能降低期望token消耗,且拒绝在生成管线中发生得越早,逐阶段节省越多。我们进一步证明条件效用估计构成鞅,确保早期的中途拒绝不会使保留样本的期望效用产生偏差。在五个指令微调模型和七个推理基准上,MSIFR作为独立方法减少11%-77%的token消耗,与早退方法结合时最高减少78.2%,同时保持或提升评估准确率。这些结果证实MSIFR提供了一种在无需额外训练或架构改动的情况下提升基于LLM的合成数据生成效率的实用机制。
