论文
小模型网页智能体中GRPO的学习率门控失败:受控零结果及其机制
A Learning-Rate-Gated Failure of GRPO in a Small Language and Vision-Language Model Web Agent: A Controlled Null and Its Mechanism
摘要
带可验证奖励的强化学习——尤其是群相对策略优化(GRPO)——如今常跑在监督检查点上,期望产出更强的智能体。我们追问:它在4B–8B规模的小型语言与视觉语言模型网页智能体上是增加了技能,还是主要重塑监督模型已有的行为。在18次运行的对照网格上(变化学习率、KL权重、种子、初始化与裁剪):没有配置能可信地改善强监督基线在智能体已基本掌握任务上的成功率。文本轨道上,中到高学习率使结果可信地变差。该零结果在配对检验、25个评估种子、6个训练种子、配方变化、文本与Set-of-Marks截图观测、以及骨干扩到8B下均成立;可信的伤害是文本轨道的发现,在Set-of-Marks下仅名义存在。为证明零结果反映设定而非管线损坏,我们在奖励可通过采样到达的任务上运行同一治控、奖励与配方:成功率以排除零的配对区间上升22分。GRPO因此只在有攀爬余地时有效——意味着采样策略已比贪婪策略更常成功。我们随后解释失败:中等学习率使智能体退化、高学习率使其崩溃,两种regime构成双重分离——嫁接把退化regime定位到注意力与MLP块,崩溃regime无法追溯到任何单组,而主导权重变化的嵌入变化因果惰性。4B下后层有效秩双向追踪能力;8B下两者分离。该耦合是小模型特有的,我们作为规模依赖报告。
