论文

还剩多少? LLM 线性编码其剩余输出长度

How Much is Left? LLMs Linearly Encode Their Remaining Output Length

模型评测模型行为与机制分析

摘要

大语言模型 一次生成一个标记,但他们的响应显示出非常一致的长度结构:逐步解决方案收敛于可预测的标记计数,检索在几句话后停止,撤回以可测量的量扩展响应。我们询问模型是否对剩余响应量进行了内部估计。在七个补全式数据集中对三个开放权重 7-8B 模型的冻结隐藏状态训练最小容量线性探针,我们发现了三个收敛的证据。首先,在发出任何输出之前,总响应长度可以仅从提示的最后一个隐藏状态线性解码。其次,在自然语言数据集上训练的探测方向广泛转移,包括训练中从未见过的受控合成完成,优于统计基线;相反的方向通常会失败,而这种不对称性本身就可以提供信息。第三,在策划的高损失完井中,当模型撤回并重新启动部分解决方案时,探测器的每个位置估计会向上移动,这是仅位置预测器无法重现的定向行为(定性的,而不是聚合的)。我们将其视为剩余生成长度的近似估计,与 Transformer 的精确计数不可能结果不同,并将其解释为 LLM 保持输出长度的类似计划的内部表示的证据(可解码,不一定按因果关系使用)。