论文
持续改进 LLM 的经验链
Chain-of-Experience for Continual LLM Improvement
摘要
人类不断从经验中学习,而传统的 大语言模型 (LLM) 评估忽略了模型通过推理时间交互进行改进的能力。在本文中,我们研究了 LLM 如何在测试时从迭代经验中学习,我们将这种设置称为经验链(CoE),其中模型通过与自我或环境反馈的迭代交互来积累经验痕迹,以形成超越零样本推理的持续改进循环。我们用不同的反馈机制实例化 CoE,包括模型自我反馈和环境信号,例如正确性或公共编码测试通过率,并使用 8 LLM(包括 GPT-5、Gemini-2.5 Pro、Claude-4.5 Sonnet)跨数学、编码和知识领域进行评估。我们的研究表明,利用迭代经验始终优于无反馈基线,仅通过自我反馈即可获得显着收益,同时任务和模型的总体改进为 5.6%,API 成本降低了 19%。我们进一步表明,结合互补的反馈渠道(例如模型和正确性信号)会产生额外的收益,并且 CoE 比现有的测试时间策略提供更高的每个词元的准确性。我们观察到 LLM 基本能力和改进能力之间存在正相关性,并表明模型在弱或虚假反馈下保持稳健,不同的反馈有助于不同的改进方面,并且大多数收益在迭代早期出现。