论文
不要掩盖环境:观察监督改变智能体在强化学习下探索的方式
Don't Mask the Environment: Observation Supervision Changes How Agents Explore Under RL
摘要
智能体轨迹记录了智能体所做的事情以及接下来发生的事情。然而,标准监督微调(SFT)仅将损失应用于代理编写的动作标记,使用环境观察作为上下文,而不是作为预测目标。我们询问这个约定是否为后续的强化学习提供了最佳的初始化。我们引入了 ActObs,它还监督每个轨迹中已经存在的观察标记。尽管部署的代理永远不会生成观察结果,但学习预测它们会鼓励策略对动作结果进行建模,而无需添加数据、参数、序列标记或前向传递。这些方法在 SFT 后执行类似,但在 GRPO 后有所不同。在 Qwen3-4B 上,ActObs 的 GRPO 在每个评估的采样预算中都实现了比 Terminal-Bench 2.0 上仅采取行动的对手更高的 pass@k。在 Qwen3-8B 上,它用一些 pass@1 可靠性换取了更高的 pass@k(在 pass@16 处+3.4 pp),并解决了更多不同的任务。这一优势还延伸到了 aider-polyglot 上的跨域代码编辑(4B 时 pass@1 处+4.2 pp),其任务在 SFT 和 RL 期间是看不见的。 ActObs 在 RL 期间保留更多的熵,同时需要更少的策略移动,使最终策略更接近其 SFT 初始化。我们的分析将这种差异追溯到 SFT:动作和观察梯度迅速变得正交,而仅动作训练留下了很大的残余观察梯度,并降低了基础模型以下的环境预测。联合监管可以防止这种片面的专业化,保留后果预测并为下游勘探制定政策。