论文
LLM 推理的提示引导多样化策略优化
Hint-Guided Diversified Policy Optimization for LLM Reasoning
摘要
大语言模型 (LLM) 的最新发展展示了令人印象深刻的推理能力,具有可验证奖励的强化学习 (RLVR) 是一种有前途的增强策略。然而,现有的奖励机制仅限于结果级别的正确性,并且缺乏明确的信号来指导模型考虑不同的解决方案。相比之下,人类解决问题通常涉及评估多种潜在方法并选择最可靠的解决方案,这是当前 RLVR 框架没有明确激励的认知过程。受此启发,我们提出了提示引导多样化策略优化(HDPO),允许模型首先列出所有潜在的候选解决方案轮廓作为提示,然后选择最可靠的一个进行进一步推理。 HDPO 包括结构化推理冷启动和提示引导多样化强化学习两个阶段,以激励模型按照“建议-选择-思考”轨迹生成多样化且可靠的解决方案。实验结果表明,HDPO有效增强了LLM的推理能力,增强了候选解的多样性以及LLM识别可靠解的能力。