论文
计划在哪里?通过轻量级机械干预在语言模型中定位潜在规划
Where's the Plan? Locating Latent Planning in Language Models with Lightweight Mechanistic Interventions
摘要
我们研究语言模型中的规划站点形成——在前向传播过程中形成结构受限的未来标记的内部表示,以及它们是否因果驱动生成。使用押韵对完成作为前瞻性约束的干净测试,我们在 Qwen3、Gemma-3 和 Llama-3 的十多个尺度上应用了两种轻量级方法(线性探测和激活修补)。探测表明,将来韵信息在行边界处是线性可解码的,并且信号在所有三个家族中随着规模的增大而增强。激活补丁显示,只有 Gemma-3-27B 因果地依赖于这种编码,表现出一种切换,其中因果驱动程序从韵词迁移到第 30 层周围的行边界。我们在整个生成过程中测试韵词条件的每个其他模型,尽管探测信号很强,但行边界处的因果效应接近于零。我们通过两阶段路径修补将 Gemma-3-27B 切换本地化到五个注意力头,从而恢复换行处约 90% 的韵律路由能力。