论文

当熵不够用之时:找回LLM输出长度预测中丢失的语义

When Entropy Is Not Enough: Reclaiming Lost Semantics in LLM Output Length Prediction

AI 基础设施推理服务

摘要

高效的LLM服务常因需要把序列填充到固定最大长度而受限,这浪费算力并降低吞吐。提前预测输出长度使长度感知调度成为可能,从而降低开销。这一优势在长上下文推理与强化学习应用中尤为突出。现有方法(如熵引导的token池化)以逐token熵为主要信号,但往往忽略token间语义内容的差异,导致重要token被低估权重,而几乎不携带信息的token获得过高权重,损害长度预测的可靠性。我们提出ESTP(Entropy-and-Semantic Token Pooling),一个轻量框架,通过把熵与基于注意力的重要性分数相结合来解决这一问题。这些分数直接来自LLM预填充(prefill)阶段计算的自注意力权重,使ESTP能以极小额外计算同时捕捉不确定性与语义重要性。由于框架复用预填充激活,它几乎不增加内存开销,只引入极小延迟。在ForeLen基准上,ESTP优于基线方法,在多数场景下取得更好的预测准确率与更低误差率。在端到端系统测试中与长度感知调度器集成后,它进一步帮助提升整体吞吐并降低填充率。我们的结果为长度感知的LLM服务系统提供了一个实用有效的构件。

当熵不够用之时:找回LLM输出长度预测中丢失的语义:论文配图
图3:ESTP 框架概览。该框架由三个主要组件构成:(1) 隐状态构建,从推理、长序列和 RL 任务等多种场景提取隐状态表示;(2) 语义与熵池化,计算基于注意力的语义权重并聚合熵值,以识别高熵高频 token(如逻辑连接词、假设性词语、推理步骤),得到组合权重 T_i;(3) 轻量级预测,将 softmax 归一化权重应用于隐状态,并把加权表示送入 MLP 预测器,以软、硬两种损失估计输出长度。