论文
Forge:面向LLM解NP难优化的质量感知强化学习
Forge: Quality-Aware Reinforcement Learning for NP-Hard Optimization in LLMs
摘要
大语言模型 (LLM) 通过可验证奖励的强化学习 (RLVR) 在推理基准测试中取得了显着的成功,擅长数学、编码、逻辑和谜题等任务。然而,现有的基准仅评估正确性,而忽略了最优性,即在约束下找到最佳解决方案的能力。我们提出了 OPT-BENCH,这是第一个通过质量感知 RLVR 训练和评估 NP 难优化问题的LLM的综合框架。 OPT-BENCH 提供三个关键组件:一个可扩展的训练基础设施,包含实例生成器、质量验证器和跨 10 项任务的最佳基线;严格的基准,包含 1,000 个实例,评估可行性(以成功率衡量)和质量(以质量比衡量);以及质量意识奖励,可以实现超越二进制正确性的持续改进。在 Qwen2.5-7B-Instruct-1M 上使用 15K 个示例进行训练,实现了 93.1% SR 和 46.6% QR,显着优于 GPT-4o,后者实现了 29.6% SR 和 14.6% QR。除了优化之外,OPT-BENCH 上的训练还转移到了不同的任务,包括数学 (+2.2%)、逻辑 (+1.2%)、知识 (+4.1%) 和指令遵循 (+6.1%)。我们的分析表明,与二元奖励相比,质量感知奖励将解决方案改进了 28.8%,并且任务多样性比数据数量更能推动泛化,从而为复杂推理的 RLVR 扩展提供了见解。
