论文
Q-干扰:内存高效的相位感知量子注意力
Q-Interference: Memory-Efficient Phase-Aware Quantum-Inspired Attention
摘要
GPT 注意力通过点积相似性来衡量词元兼容性。这种机制简单、有效且内存效率高。但它并没有明确地模拟强词元特征是否应该相互加强或抑制。我们引入了 Q-Interference,这是一种完全经典的受量子启发的注意力机制,用于自回归语言建模,它通过幅度和学习阶段来增强每个查询和关键特征。由此产生的注意力分数是阶段感知的,一致的阶段会做出建设性的贡献,而冲突的阶段会做出破坏性的贡献。尽管 Q-Interference 比单独的相似性产生更丰富的交互规则,但 Q-Interference 的简单实现需要大的标记对特征交互张量,这使得它占用大量内存并且通常不切实际。为了解决这个限制,我们提出了一种精确的三角分解,它使用两个标准矩阵乘法来计算相同的分数,避免了大中间张量的具体化。 Q-Interference 直接适合 GPT 中的 Transformer 块,并使模型架构的其余部分和下一个词元预测目标保持不变。对公共基准数据集和基线模型的实验表明,所提出的重构在受控 GPT 式设置中稳定地进行训练,并且相对于朴素的相位感知干扰注意力提供了一致的记忆优势。这些结果支持了这项工作的具体贡献:精确的内存高效重构,使相位感知干扰注意在标准 GPT 管道中变得实用。