论文
RASPRef:大型推理模型的检索增强自监督提示细化
RASPRef: Retrieval-Augmented Self-Supervised Prompt Refinement for Large Reasoning Models
摘要
最近以推理为中心的语言模型(例如 DeepSeek R1 和 OpenAI o1)在结构化推理基准(包括 GSM8K、MATH 和多跳问答任务)上表现出了强大的性能。然而,它们的性能对提示的制定仍然高度敏感,并且设计有效的提示通常是一个手动和迭代的过程,不能很好地跨任务或领域扩展。为了解决这个限制,我们引入了检索增强自监督提示细化(RASPRef),这是一个无需人工注释或特定任务监督即可改进提示的框架。该方法检索相关示例和先前生成的推理轨迹,并利用多样本一致性、验证者反馈和模型生成的批评等信号来迭代地完善提示。与之前主要关注改进模型输出的方法不同,RASPRef 直接将提示视为优化目标,并通过迭代检索引导的细化过程对其进行改进。对 GSM8K 式数学推理任务的实验表明,与静态提示基线相比,检索引导的提示可以提高性能。我们进一步讨论检索质量、轨迹选择和自我监督反馈信号如何影响即时细化的有效性。这些发现表明提示设计仍然是面向推理的语言模型的关键因素,并且自我改进的提示为提高推理性能提供了实用且可扩展的策略。