论文

上下文学习的自适应均值估计与梯度流分析

Adaptive Mean Estimation by In-Context Learning: A Gradient-Flow Analysis

模型评测模型行为与机制分析

摘要

TabPFN 等先验拟合网络 (PFN) 现在可以与跨预测和估计任务的既定统计程序相媲美。一个自然的解释是,PFN 具有统计适应性的特性,也就是说,它们的性能几乎与为一组异构模型的真实数据生成模型量身定制的方法一样好,同时不知道数据来自哪个模型。我们研究如何在受控位置估计问题中学习这种适应性。每个任务都是一个未标记的样本,其家族是隐藏的:高斯数据要求平均,阶次误差为 $n^{-1}$,而均匀数据最好从极值估计,速度更快 $n^{-2}$。我们还提供了对称高斯混合的示例,可以达到 $σ^2_n/n$ 的速率。在标量输入上,softmax 注意力计算经验累积量生成函数的导数。因此,单个基元既提供了区分族的特征,又形成了在样本均值和中间范围之间插值的估计器。我们通过专家的 softmax 混合或门控线性单元 (GLU) 将注意力专家结合起来,并分析阶段性梯度流。通过 $\widetildeΩ(n^{1+ε})$ 预训练任务,学习的估计器在高斯任务上是渐近有效的,在统一任务上的极小最大速率的 $n^ε$ 因子内,并且在收缩方差状态下的混合上是顺序最优的。这些保证延伸到新的地点和更长的环境。风险分解将专家错误、路由错误和标准化错误分开,从而澄清了架构对比。 Softmax 门控强制标准化和精确的平移等方差,而 GLU 必须学习它:它的动力学分为快速偏差消除和缓慢的专家选择。 端到端实验恢复了预测的专业化。

上下文学习的自适应均值估计与梯度流分析:论文原图
图 2:Softmax MoE,联合训练与统一替代方案。左:跨运行的 $(\bar{w}_{1\mathrm{G}},\bar{w}_{1\mathrm{A}})$,按迭代着色。中:中值 $|\lambda_{1}|$ 和 $|\lambda_{2}|$,其中细线是单独的运行。右图:$\widehat{\mu}$ 在高斯和均匀环境下的中值验证误差,以样本均值和样本中值作为参考。阴影覆盖所有十次运行。