论文

测试时贝叶斯非参数记忆推理策略的适应

Test-Time Adaptation of Reasoning Strategies with Bayesian Nonparametric Memory

摘要

虽然现代大语言模型 (LLM) 已经接受过通过语言思维链进行推理的训练,但由于达到最终答案的路径不理想,生成成本大幅增加。此外,随着在观察各种输入查询(例如通过自我反思)时发现新的见解,将这些发现应用于后续问题的机制有限。人们可以将此类策略或行为的列表视为不断增长的备忘单,其中包含从推理时的记忆模块检索的元素。在这项工作中,我们考虑了结构化的备忘单,以及学习到的行为集群。我们在行为嵌入上引入了分层狄利克雷过程高斯混合模型(HDP-GMM),它跨域共享组件,同时允许特定于域的混合权重,并使用后验预测来检索查询的相关行为;我们称之为 $\textit{Bayesian Cheatsheet}$。这种机制允许在在线测试时训练 (TTT) 设置中进行廉价的适应,在每个样本之后轻轻更新混合物的足够统计数据,并在合成的行为足够新颖时创建新组件。我们证明,即使在冷启动设置下,贝叶斯 Cheatsheet 也能在 AIME'25、Omni-MATH 和 PhysReason 等推理基准测试中相对于现有记忆模块实现明显的性能提升。我们证明贝叶斯备忘单是一个自适应重组的记忆模块,因为可以通过折叠吉布斯采样的单个步骤将行为重新分配给组件。我们的研究结果强调了贝叶斯启发的记忆模块对于有效测试时适应的价值以及结构在元认知推理中的作用。