论文
SepSeq:LLM 中长数值序列处理的 无需训练 框架
SepSeq: A Training-Free Framework for Long Numerical Sequence Processing in LLMs
摘要
虽然基于 Transformer 的 大语言模型 (LLM) 理论上支持大量上下文窗口,但在处理长数值序列时,它们的性能会严重下降。我们将这种失败归因于 Softmax 机制中的注意力分散,导致模型无法集中注意力。为了克服这个问题,我们提出了分离序列(SepSeq),这是一种 无需训练 即插即用框架,通过策略性地插入分隔符来减轻分散性。从机制上讲,我们证明分隔符标记充当注意力接收器,重新调整注意力以关注本地部分,同时保留全局上下文。对 9 个广泛采用的 LLM 的广泛评估证实了我们方法的有效性:SepSeq 在不同领域的平均相对准确度提高了 35.6%,同时平均减少了总推理词元消耗 16.4%。