论文
一个精炼器可以解锁所有这些:通过强化查询精炼进行推理时推理启发
One Refiner to Unlock Them All: Inference-Time Reasoning Elicitation via Reinforcement Query Refinement
摘要
由于模糊的人类查询与机器激活所需的结构化逻辑之间的分布不匹配,大语言模型(LLM)经常无法利用其潜在推理能力。现有的对齐方法要么单独产生 微调 每个模型的 $O(N)$ 成本,要么依赖无法解决查询级结构复杂性的静态提示。在本文中,我们提出了 ReQueR (\textbf{Re}inforcement \textbf{Que}ry \textbf{R}efinement),这是一个将推理启发视为推理时间对齐任务的模块化框架。我们通过强化学习训练专门的 Refiner 策略,将原始查询重写为显式逻辑分解,将冻结的 LLM 视为环境。植根于教育心理学的经典“最近发展区”,我们引入了自适应求解器层次结构,这是一种课程机制,通过动态调整环境难度与精炼者不断发展的能力来稳定训练。 ReQueR 在不同的架构和基准测试中产生了 1.7\%--7.2\% 的一致绝对增益,平均比强大的基线高 2.1\%。至关重要的是,它为一对多推理时间推理启发提供了一个有前途的范例,使在一小部分模型上训练的单个 Refiner 能够有效地解锁各种看不见的模型中的推理。代码可在 https://github.com/newera-xiao/ReQueR 获取。