论文

测试时推理的探索驱动优化 大语言模型 推理

Exploration-Driven Optimization for Test-Time Large Language Model Reasoning

模型训练强化学习

摘要

后训练 技术与推理时间缩放相结合,显着增强了 大语言模型 (LLM) 的推理和对齐能力。然而,出现了一个根本性的矛盾:推理时间方法受益于相对平坦的概率分布的多样化采样,而基于强化学习 (RL) 的 后训练 本质上会锐化这些分布。为了解决这个问题,我们提出了探索驱动优化(EDO),它将奖励偏置风格的探索目标扩展到迭代 后训练 并将其集成到标准 RL 目标中,鼓励采样解决方案的多样性,同时促进更有效的推理时间计算。我们将 EDO 合并到迭代直接偏好优化 (iDPO) 和组相对策略优化 (GRPO) 中,产生两个变体:ED-iDPO 和 ED-GRPO。大量实验表明,ED-iDPO 和 ED-GRPO 都表现出更大的解决方案多样性和更高的推理能力,特别是与自洽等测试时计算技术相结合时。在三个分布内推理基准测试中,EDO 比最强基线实现了 1.0-1.3% 的改进,并在五个分布外任务上提供了额外 1.5% 的平均增益。除了准确性之外,EDO 还保留了模型熵并稳定了 RL 训练动态,突出了其在防止过度优化崩溃方面的有效性。总而言之,这些结果将 EDO 确立为平衡 LLM 推理中的探索和利用的实用框架,特别是在依赖测试时间缩放的设置中。