论文
面向大语言模型的免训练推理时自我反思与成本受限早停
Training-Free Inference-Time Self-Reflection and Cost-Bounded Early Stopping for Large Language Models
摘要
推理型LLM的强化学习训练(如GRPO)成本高昂且需要可控环境,会把每一项改进都绑定到完整训练管线上。我们提出EvoResearcher,一个免训练、推理时的协议,为单个冻结LLM骨干添加成本受限的自我反思。该协议迭代"生成→自我批评→修订",直到达到最大深度D或批评返回CONFIRMED哨兵——一种隐式早停,使骨干在严格计算预算下自验证其答案。四个自我反思型元奖励组件(正确性、效率、反思深度、工具调用多样性)作为设计原则以提示级机制实例化,因此其收益在零梯度更新下即可获得。我们在Big-Bench Hard(100题)上验证该协议,并在同一冻结骨干上建立GSM8K(500题)和MATH(500题)上的跨领域行为,同时在Qwen2.5-72B上完成跨模型复现。所有实验均使用纯推理基准;工具调用多样性组件以提示级形式得到验证,环境级与多智能体扩展则是留给未来工作的设计蓝图。在干净的BBH上,该协议未能将准确率提升到95% Wilson区间之外;其价值在于成本受限的自我验证——CONFIRMED早停在准确率相同的情况下终止了82–88%的题目(每题约2.1次生成)。
