论文
思想政策:通过测试时政策演变扩展大语言模型推理
Policy of Thoughts: Scaling LLM Reasoning via Test-time Policy Evolution
摘要
大语言模型(LLM)在复杂长程推理上表现挣扎,原因在于其冻结策略假设造成的不稳定性。当前测试时扩展方法仅将执行反馈当作过滤或重写轨迹的外部信号,而未将其内化以改进底层推理策略。受波普尔“猜想与反驳”认识论启发,我们认为智能需要通过从失败尝试中学习来实现模型策略的实时进化。我们提出Policy of Thoughts(PoT),一个将推理重构为实例内在线优化过程的框架。PoT首先通过高效探索机制生成多样候选解,然后使用组相对策略优化(GRPO)基于执行反馈更新一个瞬态LoRA适配器。这种闭环设计实现了对模型推理先验的动态、实例特定精化。实验表明PoT显著提升性能:4B模型在LiveCodeBench上取得49.71%准确率,尽管规模小50倍以上,仍超越GPT-4o和DeepSeek-V3。
