论文
长度值模型:词元级 长度建模的可扩展值预训练
Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling
摘要
词元是现代自回归模型中的基本计算单位,生成长度直接影响推理成本和推理性能。尽管它很重要,但现有的方法主要在粗略序列级别上对长度进行建模。我们引入了长度值模型(LenVM),这是一个 词元级 框架,可估计每个解码步骤的剩余生成长度。通过将长度建模制定为价值估计问题,并为每个生成的词元分配恒定的负奖励,LenVM 可以预测有界的贴现回报,该回报是剩余生成范围的单调代理。这种价值表述提供了无注释、密集、公正和可扩展的监督。 LLM 和 VLM 上的实验表明,LenVM 支持精确控制、连续性能——高效转向、长度预测和解释。在 LIFEBench-token 上,它一次性将 Qwen2.5-7B-Instruct 的精确长度得分从 30.9提高到 64.8,与 LCG 结合时达到 83.6。 GSM8K 上的词元接近 200,LenVM 在 Pass@1 上保留了约 63%,而在硬 词元预算 下则保留了 6%。在其他设置中,LenVM 比提示和 EOS 校准提高了匹配长度质量,而其长度预测精度随着规模的增加而提高,并超过了专门的预测器。其 词元级 值还可以识别较长和较短轨迹之间的转变标记。这些结果将生成长度确定为有效的可扩展 词元级 值信号,用于控制、预测和基于未来值的训练。