论文

通过不断发展的图书馆进行测试时学习

Test-Time Learning with an Evolving Library

摘要

我们引入了 EvoLib,这是一个测试时学习框架,使 大语言模型 能够跨问题实例积累、重用和发展知识,而无需参数更新或外部监督。我们的方法不是调整模型参数,而是维护一个共享的知识抽象库,包括从模型自身的推理轨迹中自动提取的模块化技能和反思性见解。为了支持持续改进,我们引入了原则性的加权和合并机制,共同优化即时效用和长期价值。随着时间的推移,这允许简单的、特定于实例的抽象演变成更通用和可重用的抽象。在数学推理、代码生成和多回合代理环境等具有挑战性的基准测试中,EvoLib 在无需 真值 反馈的情况下,大幅改进了顶级测试时间扩展和学习方法。