论文

QV 或许就足够了:探索大语言模型中注意力的本质

QV May Be Enough: Toward the Essence of Attention in LLMs

模型架构Transformer

摘要

本文从第一性原理出发,并立足以词性(POS)与句法分析为中心的语言学视角,探索并推导 Transformer 架构中查询-键-值(QKV)机制的底层本质。基于这一理论基础,我们为包括 MQA、GQA 和 MLA 在内的当代架构的有效性提供统一解释框架,同时指出它们固有的权衡与潜在优化路径。我们提出 QV 范式,并为其有效性提供实证证据。在此基础上,我们提出 QV-Ka 优化方案,并通过实验验证进一步加以佐证。本工作对 QKV 机制的可解释理论分析,为大语言模型架构的未来演化奠定了坚实基础。

QV 或许就足够了:探索大语言模型中注意力的本质:论文配图
图1:LLM注意力机制中不同Token之间的匹配关系示意。