论文

早期问题的计算可以帮助大语言模型解决新问题吗?

Can Computation from Earlier Problems Help LLMs Solve New Ones?

模型推理KV Cache

摘要

大语言模型通常会解决同一对话中的独立问题。早期问题的计算可以帮助他们解决新问题吗?为了回答这个问题,我们首先进行初步实验,表明即使在同一域内,保留的历史记录也可以提高或降低后期精度。为了理解这些影响,我们使用受控重放来隔离特定于每个问题历史记录配对的内部状态变化。在不同的历史中,这些变化保留了当前问题之间的相似关系。为了改进保留历史记录下的推理,我们引入了 STAIR(Stale-Token Attention for Inter-query Reuse)。 STAIR 从固定库中早期响应生成中捕获键和值。当当前查询在提示处理期间读取此库时,它学会重定向当前查询。基础模型保持冻结状态;仅训练了 12,288 个参数。在三个 Qwen 模型和四个基准测试中,STAIR 比历史上未修改的模型提高了平均后期转弯准确度高达 11.67 个百分点。