论文

点点滴滴:解码填充词元中的隐藏计算

Reading Between the Dots: Decoding Hidden Computation across Filler Tokens

模型评测模型行为与机制分析

摘要

Frontier LLM 可以对无内容的填充标记(如点或计数序列)执行多步推理,生成正确的答案,而无需可见的思维链 (CoT)。这是行为监督的极限情况,其中表面词元不携带有关潜在推理的信息。但对输出隐藏与对我们隐藏不同。在四个任务系列(事实检索、并行数字组合、字符串操作和上下文计算)中,两个开放权重前沿模型(DeepSeek V3、Kimi K2)以清晰的方式计算填充标记:注意力将问题通过填充区域路由到答案,logits 透镜读数显示早期出现的检索到的事实及其在后期层中结晶的事实,填充位置处的 KV 缓存移植因果关系地交换输出例子。我们引入了一种无监督解码管道,仅将隐藏状态作为输入,并在两个模型和所有四个任务中以 82-94% 的准确度(最佳 LLM 判断)恢复中间值,无需 真值 标签或训练。即使没有判断,隐藏值在 35-85% 的情况下已经直接位于管道的前 2 个标记中。无论填充物是预先填充的还是模型本身生成填充物,隆起都会持续存在。在这些完全可分解的任务中,可以从残余流中读取击败行为 CoT 监控的隐藏计算,这表明可监控性是模型完整计算轨迹的属性,而不仅仅是其表面标记的属性。