论文

运气不等于能力:配对采样何时有助于语言智能体的组相对强化学习

Luck Is Not Skill: When Do Paired Rollouts Help Group-Relative RL of LLM Agents?

模型训练强化学习

摘要

与组相关的强化学习会比较相同提示的采样轨迹,但独立的环境噪音可能会掩盖这些比较。我们研究配对采样轨迹,它们在每个组内共享一个事件键控噪声计划,同时保留每个采样轨迹的边际分布。配对消除了奖励对比方差的计划间部分,但不需要减少梯度方差。对于单侧分级机噪声,我们推导了减少的精确条件,并给出了一个反例,其中奖励对比度提高,而梯度方差增加。一项对照研究在工具故障和平地机翻转的情况下训练 2B 工具使用智能体,每个设计使用三个种子。该协议已在已披露的、先前完成的试点中注册。在工具故障下,配对将最终的噪声测试成功率平均提高了 5.1 个百分点,所有三个种子差异均为正值,但未达到注册的学习曲线标准。在评分者翻转下也错过了该标准:验证 AUC 差异为 +0.003(95% 区间 [-0.029,+0.033])。对来自两个故障训练轨迹的八个不同检查点进行梯度探测,发现两种噪声类型下均值中心协方差轨迹较低:平地机翻转为 21% 至 30%,工具故障为 40% 至 63%。这些有限样本测量支持方差机制,但没有建立一般的学习速度优势。结果区分了改进奖励比较、减少估计方差和改进学习。