论文

上下文固定:当演示的标签覆盖少样本分类中的语义时

In-Context Fixation: When Demonstrated Labels Override Semantics in Few-Shot Classification

模型评测模型行为与机制分析

摘要

虽然随机演示标签几乎不会损害上下文学习(Min et al., 2022),但我们表明,同质标签(即使是语义上有效的标签)在 6 个模型(Pythia、Llama、Qwen;0.8B--8B)和 4 个任务中的准确率下降到 <=12%。触发器是标签槽内容:模型将占据标签位置的标记视为详尽的答案词汇,将同质性视为最大折叠情况。一项新颖的集合级固定发现证实了这一点:当演示携带来自 {foo,bar,vex,nit,orb} 的各种无意义标记时,模型将 42--67% 的概率放在演示的集合上,而 P(dog) 保持在 0.2% 以下。这与潜在概念贝叶斯账户不一致(Xie et al., 2022),并揭示了 ICL 输出是受限词汇检索——该模型将其输出绑定到所展示的词元库存,而不管语义合理性如何。该效果可推广到 4 向分类(三个模型 1B--8B 的准确度为 0%)和多标记语言表达者(“非常积极”),其中我们将固定分解为格式级别(模板采用)和内容级别(极性覆盖)组件,这些组件在实验上是可分离的。从机制上讲,Pythia-1B 上的每项配对激活修补可恢复 98.4% 的间隙(95% CI [84%, 112%]),将固定定位到以第 7 层为中心的电路(排名 2/560,第 99.8 个百分位数;4 倍 CV 平均值为 103%)。 Llama-3.2-1B 上的跨架构 logits 镜头通过因果确认复制编码然后覆盖轨迹(前 5 层:89% 恢复率)。