论文
单点干预失败:分布式输出模板推动情境学习
Single-Position Intervention Fails: Distributed Output Templates Drive In-Context Learning
摘要
了解 大语言模型 如何从几次演示中编码任务身份是机械可解释性中的一个核心开放问题。先前的工作使用线性探测来定位任务表示,报告特定层的高分类准确性。我们揭示了一个惊人的分离:探测准确性完全无法预测因果重要性。单位置激活干预在 Llama-3.2-3B 的所有 28 层上实现了 0% 的任务转移,尽管在这些相同位置的探测精度为 100%。这个空结果本身就是一个重要发现,表明任务编码从根本上来说是分布式的。多位置干预——同时替换所有演示输出词元上的激活——在第 8 层实现高达 96% 的转移(N=50,95% CI:[87%,99%]),首次精确定位 ICL 任务身份的因果轨迹。我们在跨越三个架构系列(LLaMA、Qwen、Gemma)的四个模型中建立了这些发现的普遍性,发现了约 30% 网络深度的通用干预窗口。因果追踪揭示了一个不对称的架构:查询位置是严格必要的(53-100% 中断),而不需要单独的演示位置(0% 中断)——解决了先前帐户中的一个关键歧义。至关重要的是,迁移取决于内部表示兼容性,而不是表面相似性(r=-0.05 vs r=0.31),从而排除了琐碎的解释。这些结果建立了分布式模板假设:ICL 任务身份被编码为分布在演示词元中的输出格式模板,从根本上重塑了我们对上下文学习如何运作的理解。