论文

为什么要对可以枚举的内容进行采样?基因组工具选择的精确策略优化

Why Sample What You Can Enumerate? Exact Policy Optimization for Genomic Tool Selection

模型训练强化学习RLVRAgentic RL

摘要

在冻结推理机上进行强化学习已成为教授外部工具调用的策略的常见方法。我们证明,在完整的工具子集空间是可枚举的专业科学环境中,这个配方在结构上变得不匹配。在那里,一小组重复计算能力覆盖了该领域,因此工具子集的空间是组合的,但小到足以枚举,并且 GRPO 仍然从少数采样的推出中估计操作期望。更糟糕的是,随着训练成功,近似值会降低:当策略集中于首选子集时,它会对它们进行重新采样,采样的奖励发生冲突,并且群体标准化优势消失。在基因组推理中,没有产生奖励信号的问题比例从统一参考策略下的 0.2% 上升到 GRPO 训练后的 20.8%。作为补救措施,我们引入了 FGPO(全组策略优化),它 (1) 对每个工具子集进行评分并优化确切的操作期望,因此每次更新都会看到完整的操作空间,并且 (2) 将每个问题子集对的奖励预先计算到详尽的表中,从训练循环中完全删除冻结推理器调用。在五个冻结推理器和三个基因组基准中,FGPO 在所有 15 种设置中均优于 GRPO 6.75 分,最高可达 14.20,而标准的按需 GRPO 计划将需要 2.4 倍的冻结推理器奖励评估,并且在 GenomeQA 上,FGPO 将每个问题调用的工具从 2.36 削减到 1.40。