论文

计划还是即兴创作?在开放模型和开放跨层转码器上对诗歌规划站点进行压力测试

Planning or Improvisation? Stress-Testing the Poetry Planning Site on Open Models and Open Cross-Layer Transcoders

模型评测模型行为与机制分析

摘要

林赛等人。 (2025) 报告称,Claude 3.5 Haiku 计划押韵:候选押韵词的特征在写入一行之前在换行符上处于活动状态,并且仅在应用时抑制和注入干预才会重定向该行(图 13)。我们测试了在一个消费者 GPU 上,在一个消费者 GPU 上,在跨越四个开放模型(0.6B 到 2.6B 参数)和六个开放跨层转码器 (CLT) 的七个单元上的推广程度,将声明分解为位置特异性 (C1)、换行站点标识 (C2) 和换行驻留计划 (C3)。这是一个压力测试,而不是忠实的再现:这些 CLT 无法获得归因图,因此从解码器向量中自下而上地找到特征。 C1 概括地说,在每个细胞中以及在 444 个提示注射对中的所有 247 个中,具有可检测到的效果,但有效位置是最终的提示标记,与发射相邻,并且只有两个细胞达到了行为上有意义的概率。 C2 和 C3 没有被任何探针恢复:对每个活动特征的普查发现换行处没有韵律预期丰富,并且在模型组成整个行时操纵换行,超过 36 个运行和 8,640 个采样行,显示了原因。这种干预很强烈,但只有一个词元长,使得注入的单词成为 720 个样本中的 703 个样本中组成行的第一个单词,并且后面的 6 个单词的押韵保持不变。最后的测试完全放弃转码器:在每一层修补换行符的整个残差,从一首最小对诗中,其第三行以不同的韵律结尾,将 1,260 行中的 11 行与基线处的 4 行移动韵律,设计分辨率为 1.4%。我们将其解读为边界条件而不是反驳:在这种规模和这些转码器下,因果位置与发射相邻。我们重现图 13 的形状,而不是其机制。代码和数据是公开的(代码:github.com/PCfVW/poetry-planning-site)。