论文
通过口头批评进行过程监督改进了 大语言模型 中的推理
Process Supervision via Verbal Critique Improves Reasoning in Large Language Models
摘要
LLM 推理的推理时间缩放主要集中在三个轴上:链深度、样本宽度和学习步骤评分器 (PRM)。我们通过言语过程监督 (VPS) 引入了第四个轴,即外部言语监督的粒度,这是一个 无需训练 框架,该框架使用来自更强大监督者的结构化自然语言批评来指导迭代生成-批评-细化循环直至一轮预算 R。在 GPQA Diamond、AIME 2025 和 LiveCodeBench V6(涵盖封闭和开放模型)中,VPS 产生了三个关键结果。首先,关于 GPQA 钻石级,GPT-5.4(高)| GPT-5.4(低)在 R=4 时达到 94.9%,超过了没有梯度更新的现有技术的 94.1%。其次,在 AIME 2025 上,VPS 实现了强大的弱者救援,将分数从 11.7-26.7% 提升到 63.3-90.0%(最高 +63.3 分)。第三,在匹配计算方面,VPS 的性能优于 Reflexion +8.5 至 +12.1 点,优于 Self-Consistency@5 +5.0 pp (GPQA) 和 +8.3 pp (LiveCodeBench),将批评粒度隔离为关键驱动因素。性能随着监督者与参与者的能力差距而变化(Pearson r=0.90),并且当错误无法用语言表达时(例如代码合成)就会降低,从而激发了混合语言可执行方法。这些结果将批判粒度确立为推理时间缩放的新轴。