论文
少样本退化并不像看上去的那样:行为证据、表示分析和跨 12 个模型、2 个任务和 2 个架构的随机文本控制
Few-Shot Degradation Is Not What It Seems: Behavioral Evidence, Representation Analysis, and a Random-Text Control Across 12 Models, 2 Tasks, and 2 Architectures
摘要
少量提示有时会降低语言模型而不是帮助它们,但为什么会发生这种情况尚不清楚。我们在两个乌克兰任务新闻分类和法律案件结果预测上评估了 12 个开放权重模型,发现其效果强烈依赖于任务:在新闻上获得 +24 个百分点的相同模型在法律文本上仅获得 +3.4 个百分点,其中两个模型的性能下降。为了理解其中的原因,我们来看看模型的内部。之前的工作测量了隐藏状态在零样本和少样本模式之间移动的程度,但少样本提示要长得多,并且仅长度差异就移动了表示。我们提出了一个简单的修复方案:用长度匹配的随机文本替换演示,以测量提示长度引起的偏移,然后减去它。由此产生的指标内容增量隔离了模型的表示由于演示内容而变化的程度,而不是它们的长度。这完全改变了情况:原始偏移不能预测少样本是否有帮助或有害(r = 0.20),但内容增量可以预测(rho = +0.65,p = 0.043)。更多地从演示内容中重构表示的模型更有利于与直观的“扭曲”解释相反。 Llama 3.3 70B 中的掩蔽演示证实了这一发现,将精度恢复到零样本基线之上。