论文

矢量策略优化:多样性训练改善测试时搜索

Vector Policy Optimization: Training for Diversity Improves Test-Time Search

模型训练强化学习

摘要

语言模型现在必须开箱即用地推广到新环境,并在推理扩展搜索程序(例如 AlphaEvolve)中工作,该程序选择具有各种特定于任务的奖励函数的采样轨迹。不幸的是,LLM 后训练 的标准范例优化了预先指定的标量奖励,通常导致当前的 LLM 产生低熵响应分布,从而难以显示推理时间搜索所需的多样性。我们提出了向量策略优化(VPO),这是一种 RL 算法,可以明确地训练策略来预测不同的下游奖励函数并产生不同的解决方案。 VPO 利用的奖励在实践中通常是向量值的,例如代码生成中每个测试用例的正确性,或者多个不同的用户角色或奖励模型。 VPO 本质上是 GRPO 优势估计器的直接替代品,但它训练 LLM 输出一组解决方案,其中各个解决方案专门针对向量奖励空间中的不同权衡。在四个任务中,VPO 在测试时搜索中匹配或击败了最强的标量 RL 基线(例如 pass@k 和 best@k),并且随着搜索预算的增长,差距不断扩大。对于进化搜索,VPO 模型解决了 GRPO 模型根本无法解决的问题。随着测试时搜索变得更加标准化,多样性优化可能需要成为默认的 后训练 目标。