论文
从模拟到实施:经过训练的语言模型能够识别自己的世代并做出反应
From Simulation to Enaction: Post-trained language models recognize and react to their own generations
摘要
语言模型被预先训练为被动预测器,没有动机对自己的输出结果进行建模。 后训练 改变了这一点:产生自己的响应的模型可以从识别它是 同策略 中受益。我们提供的证据表明,经过训练的模型可以识别其 同策略 代,并且这种识别隐式编码在其输出分布中。特别是,在模型系列和尺寸类别中,同策略 输出分布熵比 离策略 熵低 3--4$\times$。我们将这种效应的一部分追溯到输入意外的内部表示,根据模型的先前预测跟踪最近输入标记的可能性,从而因果地调节输出熵。这些现象的一个例子可以在对开放式提示的反应中观察到。后训练模型(与预训练模型不同)在第一个输出标记之前消除了对其即将响应的主题的不确定性;使用不同主题的预填充违反此缓存意图会导致更高的输出熵。我们还测试了模型是否可以通过明确的口头报告区分 同策略 上下文和预填充。我们发现它们可以,但有趣的是,这种显式识别通过与隐式识别不同的机制。