论文
向量能承载多少个思维?通过叠加实现推理的容量研究
How Many Thoughts Can a Vector Hold? The Capacity of Reasoning by Superposition
摘要
大语言模型通过多步推理中的中间计算解决复杂问题。传统思维链将这些计算编码为标记。近期的连续和递归方法则将部分计算移入固定维度的潜在状态,在其中单个思维可叠加多个替代方案。这引发一个根本性设计问题:推理推进过程中,连续思维应保留什么?一种直观做法是丢弃过往计算,仅保留当前推理前沿。存储更多项目似乎会稀释状态并浪费有限的表征容量。我们证明这种直觉可能错误。在相同的下游计算下,累积叠加保留完整推理历史的方案,其所需表征维度可能低于仅保留当前替代方案的前沿叠加。在固定隐藏宽度下,这种优势使潜在推理器能保留更多有效证据,区分更多可能的下游结果,并延迟压缩状态变得不可靠的临界点。这种反直觉效应出现的原因是,有信息量的历史组件能相互一致地强化,而无关替代方案则引入随机干扰。这一视角也回答了实际设计问题:当未来使用未知时,模型应如何加权潜态中积累的记忆?在可重用的加权叠加中,优先选择少量近期或显著的项目会产生表示弱的内存,从而成为后续注意力的瓶颈。均匀累积加权可避免这一缺陷,我们证明其在鲁棒的未来推理中是极小极大最优的。我们的结果将叠加从一种观察到的潜在空间现象转变为一种设计原则:平衡的累积记忆能使固定表征预算支持更可靠、可重用的计算。