论文

思想政策:通过测试时政策演变扩展大语言模型推理

Policy of Thoughts: Scaling LLM Reasoning via Test-time Policy Evolution

模型训练强化学习RLVR

摘要

大语言模型(LLM)在复杂长程推理上表现挣扎,原因在于其冻结策略假设造成的不稳定性。当前测试时扩展方法仅将执行反馈当作过滤或重写轨迹的外部信号,而未将其内化以改进底层推理策略。受波普尔“猜想与反驳”认识论启发,我们认为智能需要通过从失败尝试中学习来实现模型策略的实时进化。我们提出Policy of Thoughts(PoT),一个将推理重构为实例内在线优化过程的框架。PoT首先通过高效探索机制生成多样候选解,然后使用组相对策略优化(GRPO)基于执行反馈更新一个瞬态LoRA适配器。这种闭环设计实现了对模型推理先验的动态、实例特定精化。实验表明PoT显著提升性能:4B模型在LiveCodeBench上取得49.71%准确率,尽管规模小50倍以上,仍超越GPT-4o和DeepSeek-V3。

Policy of Thoughts:通过在线策略进化扩展LLM推理的测试时训练
图4:在推理基准上的总体性能。PoT 取得最高分(58.98%),显著优于自我改进(self-refinement)方法、基于搜索的方法以及标准推理基线。它还超越了 AB-MCTS 与 ReinforceMCTS 等近期的 MCTS 增强方法,证明了其统一的思维树引导策略演化框架的有效性。