平衡 k-Shot 采样下的精确简并:LLM 嵌入的小样本判别分析的后果
Exact Degeneracy Under Balanced k-Shot Sampling:Consequences for Small-Sample Discriminant Analysis on LLM Embeddings
摘要
平衡 k-shot 采样为每个类准确抽取 k 个标记示例。我们证明,它会在小样本判别估计量家族中引起精确的、可证明的简并性。在平衡采样下,核化线性主成分判别分析(KLPCDA)的类内散射算子不仅是秩亏的,而且实际上是一个缩放的正交投影仪。我们以封闭形式推导出结果:KLPCDA 的七个变体中的两个每个信号特征值都完全相等,因此它们的特征向量选择标准可证明是无关紧要的而不是病态的,第三个具有可证明无效的目标。这是根据估计者的构造得出的,而不是任何数据集;我们在冻结句子嵌入和仅解码器生成模型的残余流激活上分别确认了这一点。公式内的平局决胜修复了两个可修复的变体,恢复由类计数控制:少类数据集上的剩余子空间约束成本比多类数据集高 5 倍 (p=0.000001)。然后,我们在冻结的 LLM 嵌入(n 远小于 d,最多 4096)上评估修复后的框架,涉及四个数据集、三个嵌入大小和三个训练基线(SetFit、LoRA、上下文学习)。在每个嵌入大小下,经过适当交叉验证的逻辑回归探针仍然在四个数据集中的三个上击败了每个 KLPCDA 变体;来自像素、振动信号和基因表达数据的指导不能直接推广到这个特征空间。三个独立的几何可分离性度量无法解释为什么一种基于高维解码器的嵌入模型的性能不如较小的双向编码器,从而排除了各向异性;该差距实质上是估计效率效应,而不是永久上限,当支持集从 k<=10 增长到 k=30-50(p=0.00195,都是多类数据集)时,差距会缩小 80% 以上。