论文
QV 或许就足够了:探索大语言模型中注意力的本质
QV May Be Enough: Toward the Essence of Attention in LLMs
摘要
本文从第一性原理出发,并立足以词性(POS)与句法分析为中心的语言学视角,探索并推导 Transformer 架构中查询-键-值(QKV)机制的底层本质。基于这一理论基础,我们为包括 MQA、GQA 和 MLA 在内的当代架构的有效性提供统一解释框架,同时指出它们固有的权衡与潜在优化路径。我们提出 QV 范式,并为其有效性提供实证证据。在此基础上,我们提出 QV-Ka 优化方案,并通过实验验证进一步加以佐证。本工作对 QKV 机制的可解释理论分析,为大语言模型架构的未来演化奠定了坚实基础。
