论文
通过动态单样本策略细化实现推理大语言模型的资源高效强化
Resource-Efficient Reinforcement for Reasoning Large Language Models via Dynamic One-Shot Policy Refinement
摘要
大语言模型(LLM)在复杂推理任务上表现出色,可验证奖励强化学习(RLVR)已成为使模型行为与推理链对齐的原则性框架。尽管前景可观,RLVR 的资源消耗仍然过高,需要大量奖励信号并在训练中产生可观的 rollout 成本。本文重新审视 RLVR 中数据与计算效率这一根本问题。我们首先建立了解锁推理能力所需样本复杂度的理论下界,并用实验验证:仅用出人意料少的训练实例即可取得强劲性能。为减轻计算负担,我们提出动态单样本策略细化(DoPR),一种不确定性感知的 RL 策略,依据奖励波动性与探索驱动的采集准则,为每次策略更新动态选取批量中单个信息量大的样本。DoPR 将 rollout 开销降低近一个数量级,同时保持有竞争力的推理精度,为 LLM 后训练提供了可扩展、资源高效的方案。该做法为推理密集型 LLM 应用走向更高效、更易得的 RL 训练提供了务实路径。
