论文

基于熵引导表示预测LLM输出长度

Predicting LLM Output Length via Entropy-Guided Representations

模型推理推理加速

摘要

LLM服务与强化学习(RL)采样中序列长度的长尾分布,导致批量推理中因过度填充造成显著的计算浪费。现有方法依赖辅助模型进行静态长度预测,但它们开销高、泛化差,且在随机的“一对多”采样场景中失效。我们提出一个轻量框架,复用主模型的内部隐藏状态进行高效的长度预测。该框架包含两个核心组件:1)熵引导词元池化(Entropy-Guided Token Pooling,EGTP),利用即时激活值与词元熵以可忽略的成本实现高精度静态预测;2)渐进式长度预测(Progressive Length Prediction,PLP),在每个解码步骤动态估计剩余长度以应对随机生成。为验证我们的方法,我们构建并发布ForeLen,一个包含长序列、思维链(Chain-of-Thought)与RL数据的综合基准。在ForeLen上,EGTP取得最先进的精度,将MAE较最佳基线降低29.16%。将我们的方法与长度感知调度器集成可获得显著的端到端吞吐提升。我们的工作为高效LLM推理提供了新的技术与评估基线。

基于熵引导表示预测LLM输出长度
图2:token 熵与重要性之间关系的实证验证。(左)箱线图显示了按熵值分入五个等宽区间的 token 的平均重要性。这表明重要性随熵增大。(右)散点图展示了熵与重要性的联合分布,回归线证实存在显著的正相关(r=0.451)。