规则摊销,配对则不然:语言结构决定哪些潜在任务表征可以取代情境学习
Rules Amortize, Pairings Don't: Linguistic Structure Determines What Latent Task Representations Can Replace In-Context Learning
摘要
上下文学习 (ICL) 可以分摊到潜在对象(任务向量、函数向量、上下文向量)中,以零样本推理成本恢复少数样本行为,但最近的理论表明,静态向量充当单个合成演示,并且在高秩映射(例如词级双射)上必须失败。我们提出这个问题的语言版本:哪些语言操作可以从提示中摊销?我们训练一个 2.6M 参数网络,该网络读取少数镜头支持集的几何形状(质心、主子空间、频谱、计算一次并缓存),并在冻结的 GPT-2-large/XL 的中深度层对查询的残余流生成输入条件的附加更新。跨越八个屈折方向和一种词汇关系,在禁止方向之间反向对泄漏的规范分割下,出现了三种状态。在前向拐点上,10 个样本 ICL 很强(0.67-0.89)并且提取的任务向量崩溃(<=0.06),该变换以严格的零样本每次查询成本与 ICL 匹配。在词形还原方向上,冻结的 GPT-2 可以执行,但 10 个演示系统地无法传达(1.5B 处的 ICL 0.13-0.48),该变换根本不受 ICL 限制:它达到 0.78-0.92,比 ICL 高达 +72 点(过去到现在:0.85 与 0.13)。在任意配对(反义词)上,每个摊销器在每个规模、容量和测试的种子上都稳定在 ICL 的一半附近。控件显示支持流形充当因果必要的任务指纹:错误的任务流形将精度降低到<=0.06,仅查询变体无法消除共享输入空间的任务的歧义,并且留一任务转移为零。生产性规则分摊到潜在的任务表征中,有时比提示更好地传达它们;记忆的配对则不然。