论文
真相就在(生成的词元)中间的某个地方
The Truth Lies Somewhere in the Middle (of the Generated Tokens)
摘要
自回归生成的隐藏状态应该如何折叠成反映语言模型内部状态的表示?尽管词元是在因果掩蔽下生成的,但我们发现其隐藏状态的均值池比单独的任何单个词元产生更多的语义表示。我们通过内核与语言、视觉和蛋白质领域的参考空间的对齐来量化这一点。通过均值池的改进与分布在生成的词元中的信息一致,而不是局限于单个位置。此外,从生成的标记派生的表示优于来自提示标记的表示,并且跨代的对齐揭示了模型行为中可解释的动态。