论文
深度循环语言模型中的预测动力学
Prediction Dynamics in Depth-Recurrent Language Models
摘要
深度循环语言模型通过重复的潜在更新来完善预测。为什么中间答案可以与终点一致,而分数却不断变化?我们得出了一个尖锐的边缘特征,它将一定程度的保守性分解为共同的翻译、相对于获胜者的方向,以及每个竞争对手的更新与其分数差距的配对。在 Huginn-3.5B 和 Ouro-1.4B 中,考虑到更新方向和竞争对手配对,除完整答案文本评分下的翻译删除之外,平均最早合格深度进一步减少了总深度的 22.5-34.4%。这种回顾性比较使用完整的轨迹。标签评分也做出了重大贡献。对于共享预测分布,我们正交分离共同运动和对比运动,并通过候选集质量和集内浓度来表达共同分量。共同能量和对比能量可以以不同的速率衰减,从而允许不断增长的偏好变化份额与不断缩小的绝对更新共存。这些发现通过观察到的分数变化的几何形状和组成解释了有限深度答案的保存。