论文

超越推理时间搜索:强化学习综合可重复使用的求解器

Beyond Inference-Time Search: Reinforcement Learning Synthesizes Reusable Solvers

模型训练强化学习

摘要

大语言模型 (LLM) 通常将组合优化作为推理时间过程,通过采样、搜索或重复提示分别求解每个实例。我们询问强化学习是否可以将部分推理成本转移到代码 LLM 的权重中,以便该模型为整个问题族合成一个可重用的求解器。我们在协同依赖选择(SDS)上研究这个问题,这是受约束二次背包的受控变体,旨在暴露特定的故障模式:局部信号和严格的可行性约束使贪婪启发式方法有吸引力但不可靠。在相同的支架下,Best-of-64 基本模型采样饱和,与全局虚拟最佳求解器 (VBS) 的差距约为 28.7%;代码审计表明,基本模型经常检索模拟退火模板,但错误地实现了 Metropolis 验收规则。我们使用可行性门控奖励和轻型结构脚手架,通过组相对策略优化 (GRPO) 来微调 Qwen2.5-Coder-14B-Instruct。由此产生的策略在 99.8% 的可行 SDS 输出中收敛到约束感知模拟退火模板,实现了与 VBS 5.0% 的差距,并且生成后执行/搜索成本比累积 Best-of-64 评估便宜 91 倍。一次编译检查表明,当在 SDS 测试集中重复使用时,每个种子的最佳冻结求解器仍然具有高度竞争力,而对作业车间调度的附加域评估提供了更狭窄但积极的证据,表明脚手架转移到了 SDS 之外。负消融揭示了该方法的局限性:标准稳定器会降低性能,软可行性门失败,结果仍然对奖励标准化和特定领域的设计选择敏感。