论文
PRISM-MCTS:通过元认知反思从推理轨迹中学习
PRISM-MCTS: Learning from Reasoning Trajectories with Metacognitive Reflection
摘要
以OpenAI o1为代表的推理模型的出现,标志着从直觉认知到审慎认知的转变,实际上将扩展定律从预训练范式重新指向测试时计算。尽管蒙特卡洛树搜索(MCTS)在该领域展现出前景,现有方法通常将每次rollout视为孤立轨迹。这种信息共享的缺失导致严重低效和大量计算冗余,因为搜索过程未能利用先前探索的洞见。为解决这些局限,我们提出PRISM-MCTS,一个受人类并行思考与反思过程启发的全新推理框架。PRISM-MCTS将过程奖励模型(PRM)与动态共享记忆相结合,同时捕捉“启发式”与“谬误”。通过强化成功策略并剪除易错分支,PRISM-MCTS有效地实现精炼。此外,我们为PRM开发了数据高效的训练策略,在少样本机制下实现高保真评估。在多个推理基准上的实证评估证实了PRISM-MCTS的效力。值得注意的是,它在GPQA上将轨迹需求减半,同时超越MCTS-RAG和Search-o1,表明它以审慎而非穷尽的推理来扩展推理规模。
