论文

面向大语言模型的免训练推理时自我反思与成本受限早停

Training-Free Inference-Time Self-Reflection and Cost-Bounded Early Stopping for Large Language Models

模型推理推理验证与自校正

摘要

推理型LLM的强化学习训练(如GRPO)成本高昂且需要可控环境,会把每一项改进都绑定到完整训练管线上。我们提出EvoResearcher,一个免训练、推理时的协议,为单个冻结LLM骨干添加成本受限的自我反思。该协议迭代"生成→自我批评→修订",直到达到最大深度D或批评返回CONFIRMED哨兵——一种隐式早停,使骨干在严格计算预算下自验证其答案。四个自我反思型元奖励组件(正确性、效率、反思深度、工具调用多样性)作为设计原则以提示级机制实例化,因此其收益在零梯度更新下即可获得。我们在Big-Bench Hard(100题)上验证该协议,并在同一冻结骨干上建立GSM8K(500题)和MATH(500题)上的跨领域行为,同时在Qwen2.5-72B上完成跨模型复现。所有实验均使用纯推理基准;工具调用多样性组件以提示级形式得到验证,环境级与多智能体扩展则是留给未来工作的设计蓝图。在干净的BBH上,该协议未能将准确率提升到95% Wilson区间之外;其价值在于成本受限的自我验证——CONFIRMED早停在准确率相同的情况下终止了82–88%的题目(每题约2.1次生成)。

面向大语言模型的免训练推理时自我反思与成本受限早停:论文配图
图1:EvoResearcher框架的概念概览。四个协同维度相结合:在正确性、路径效率、反思深度和工具调用多样性之上的自反思元奖励(M3);注入时间相关与对抗性内容(专家意见、科学撤稿、延迟证据、误导性材料)的演化虚拟世界(M1);超越事实检索、面向假设生成与矛盾解决的发现型任务(M2);以及由具有任务专业化的Scout/Filter/Synthesizer智能体组成的异构多智能体集群(M4)。该智能体借助检索与搜索工具基础设施,并通过基于网络规模语料的课程强化学习进行训练。在本工作中,元奖励组件被实现为在冻结主干之上、免训练的推理时自反思协议(第3.1节);此处描绘的RL训练流程、演化环境和多智能体集群属于设计蓝图,未经评估(第5节)。