论文
池化有帮助,学习权重会伤害上下文:分解群体注意力
Pooling Helps, Learned Weighting Hurts In-Context: Decomposing Group Attention
摘要
时间序列预测模型 Chronos-2 引入的群体注意力,以固定补丁索引关注群体的变量,并服务于多变量 (MV) 和上下文学习 (ICL) 预测。我们不是从整体上评估这种跨变量注意力设计,而是询问该机制的哪一部分获得了收益,并探讨其对 MV 和 ICL 机制的适用性。通过在推理时编辑注意力矩阵 $α$,我们将 head 包含的两条路径分开:V/O(投射组的加权摘要)和 Q/K(决定权重)。统一池化(没有任何 Q/K 权重的 V/O)在我们 20 个传感器网络配置中的 18 个上是正的,而学习权重 (Q/K) 按组类型划分:它的贡献对于 MV 是正的或可以忽略不计,但会严重降低 10 个传感器网络 ICL 配置中的 8 个,其中 4 个比单变量推理更差。通过隔离不同层的影响,我们发现仅在第一个块中统一 $α$ 就可以改善我们测试的每个 ICL 配置。