论文
当熵不够用之时:找回LLM输出长度预测中丢失的语义
When Entropy Is Not Enough: Reclaiming Lost Semantics in LLM Output Length Prediction
摘要
高效的LLM服务常因需要把序列填充到固定最大长度而受限,这浪费算力并降低吞吐。提前预测输出长度使长度感知调度成为可能,从而降低开销。这一优势在长上下文推理与强化学习应用中尤为突出。现有方法(如熵引导的token池化)以逐token熵为主要信号,但往往忽略token间语义内容的差异,导致重要token被低估权重,而几乎不携带信息的token获得过高权重,损害长度预测的可靠性。我们提出ESTP(Entropy-and-Semantic Token Pooling),一个轻量框架,通过把熵与基于注意力的重要性分数相结合来解决这一问题。这些分数直接来自LLM预填充(prefill)阶段计算的自注意力权重,使ESTP能以极小额外计算同时捕捉不确定性与语义重要性。由于框架复用预填充激活,它几乎不增加内存开销,只引入极小延迟。在ForeLen基准上,ESTP优于基线方法,在多数场景下取得更好的预测准确率与更低误差率。在端到端系统测试中与长度感知调度器集成后,它进一步帮助提升整体吞吐并降低填充率。我们的结果为长度感知的LLM服务系统提供了一个实用有效的构件。
