论文
前缀什么时候可以编译LoRA?针对冻结注意力的精确资源上限测试
When Can Prefixes Compile LoRA? Exact Resource-Capped Tests for Frozen Attention
摘要
当注意力头保持冻结状态时,固定的连续前缀是否可以取代给定的低秩适配器?在这项研究中,我们通过三个条件表明答案取决于适配器的目标。首先,可观察性:在一次因果读出中,每个独立的键值前缀只能通过查询、注意力分区和值分子看到内容,因此在具有相同摘要的两个输入上不同的目标会在每个前缀长度处产生错误平台;规范上限将这一下限扩展到几乎相等的摘要。其次,可实现性:在常见查询中,任何前缀都精确地减少为两个聚合变量,并且范数上限最优是获得的二阶锥程序,也是在固定输出投影之后;它将两个等范一级值更新放置在可编译性的相反两侧。第三,实现:在仿射查询暴露下,$2r$签名槽近似于rank-$r$值更新,但它们的值以$O(ε^{-3/2})$增长,并且该结构通过了float64中的所有400个容差检查,但在bfloat16中仅通过了38个。具有固定词元和位置的第一层 GPT-2 读出满足公共查询条件,无需钳位激活;在三个这样的头处,上限最优留下 18.4% 到 74.2% 的预计适配器效果未编译,并具有依赖于头的值——查询排序。所有主张都涉及一个头的局部近似,而不是整个网络的等效性。