论文

MILES:具有可学习选择的模块化指令存储器,用于自我改进 LLM 推理

MILES: Modular Instruction Memory with Learnable Selection for Self-Improving LLM Reasoning

摘要

大语言模型 (LLM) 通过额外的计算在测试时不断改进他们的推理,但大多数现有的工作都是孤立地处理每个问题。当问题依次出现时,积累可重用的经验可以进一步提高性能。现有的基于内存的方法要么存储对新问题泛化能力较差的整体解决方案模板,要么使用未针对最终答案正确性进行优化的启发式步骤级别选择。学习选择策略需要大规模的训练数据和固定的动作空间,使得此类方法不适合内存逐渐扩展并且只能进行有限监督的测试时设置。我们提出了 MILES(带有 LEarnable Selection 的模块化指令内存,用于自我改进 LLM 推理),这是一个动态扩展逐步内存并在实际测试时间限制下应用正确性优化内存组合的框架。 MILES 维护由不对称的子目标嵌入和子指令对组成的模块化存储单元,每个子目标嵌入和子指令都与一个可学习的选择头相关联。这种内存结构实现了从粗到精的检索机制:粗级可实现内存扩展,并收集来自置信样本的训练选择头的监督,而精细级应用学习到的选择头对粗级候选进行重新排序并指导不确定样本的推理。 MILES 始终匹配或优于先前的方法,同时实现卓越的准确性与效率权衡。大量的实验证明了其有效性、稳健性和可移植性。