奖励通道中的暗室:密集预测奖励使GRPO智能体训练崩溃
The Dark Room in the Reward Channel: Dense Prediction Rewards Collapse GRPO-Trained LLM Agents -- and The Channel, Not the Content, Decides What Works
摘要
密集逐步监督常被用于解决长程LLM智能体的稀疏奖励问题:奖励策略对下一步观察的预测,在基于势函数的奖励塑形理论下看似安全。已有预测奖励和辅助损失方法既报告成功,也报告不稳定。本文用74个预注册实验组,在ALFWorld、WebShop、合成POMDP及Qwen3-1.7B/4B/8B上分析同一固定预测信号,仅改变传递机制。 第一,在保留标准差归一化、没有过滤、动态采样或解耦缓解措施时,持续使用这种差分形式奖励的11次运行均崩溃,涵盖不同规模、系数和分组设置;有下界的合成环境则停滞。在ALFWorld上,运行进入吸收态,预测准确率趋于1.0而任务成功率趋于0,形成“暗室”。在全部失败的组中,z-score归一化抵消塑形系数;仅去掉标准差归一化即可恢复与基线相当的表现。第二,信号风险取决于组内方差轨迹,并受可被利用程度影响;这一解释能够回溯奖励通道崩溃,也经受了预注册前瞻测试。 第三,把同一信号作为教师强制辅助损失时,ALFWorld的4B配置未发生上述危害,但收益不来自信号内容本身:无内容对照在两个匹配种子中达到或超过标准目标信号,分别为78.8对68.6、67.9对57.9,起作用的是辅助更新带来的正则化。第四,在8B配置中出现双稳态:标准目标信号按完整权重使用时,三个种子中两个陷入锁定状态;无内容或降低权重的实验组均保持正常。 ALFWorld和WebShop中,没有奖励通道变体明显超过采用匹配归一化的基线,也没有标准目标信号明显优于其无内容对照。作者据此指出,决定效果的是信号如何传递,而非内容本身;安全的通道随训练配置而变化。