论文
使用因果和屏蔽语言模型进行情境学习的统一框架
A Unified Framework for In-Context Learning with Causal and Masked Language Models
摘要
上下文学习 (ICL) 已成为预训练语言模型的核心功能,但其理论分析主要集中于通过从左到右自回归预测训练的因果语言模型,例如 GPT 式模型。相反,屏蔽语言模型从双向上下文中恢复屏蔽标记,并且它们在 ICL 中的作用仍然不太了解。我们开发了一个统计学习框架,通过经验测量和模型预测来表示上下文示例,作为上下文和查询的函数。这种表述将自回归和屏蔽预训练目标置于常见的过度风险分析中。在 Wasserstein 型规律性条件下,我们将 T 个任务和每个任务 N 个样本的预训练与推理时的 k 次超额风险联系起来,获得屏蔽目标和自回归目标的同阶上限。我们还研究任务分配转移,其中预训练任务从 P 中采样,推理任务从 Q 中采样;由此产生的边界包含由 P 和 Q 之间提升的 Wasserstein 距离控制的附加项。该边界进一步意味着固定预训练数据预算下的顺序最优分配和内在低维结构下的细化率。受控函数学习任务的实验表明,掩码对编码器 (MPE) 可以实现与 GPT-2 式因果 Transformer 相当的性能,这表明 ICL 行为并非特定于因果语言模型。