论文
SOLAR-RL:半在线长视野分配强化学习
SOLAR-RL: Semi-Online Long-horizon Assignment Reinforcement Learning
摘要
随着多模式 大语言模型 (MLLM) 的成熟,GUI智能体 正在从静态交互演变为复杂的导航。虽然强化学习 (RL) 已成为在动态 GUI 任务上训练 MLLM 代理的一种有前途的范例,但其有效应用面临着困境。标准离线强化学习通常依赖于静态步骤级数据,忽略全局轨迹语义,例如任务完成和执行质量。相反,在线强化学习捕捉了长期动态,但面临着高交互成本和潜在的环境不稳定的问题。为了弥补这一差距,我们提出了 SOLAR-RL(半在线长视野分配强化学习)。我们的框架不是仅仅依赖昂贵的在线互动,而是将全球轨迹洞察直接集成到离线学习过程中。具体来说,我们从静态数据中重建不同的候选交互轨迹,使用每步有效性信号检测第一个故障点,并通过目标对齐整形追溯分配密集的步骤级奖励,以反映轨迹级执行质量,有效地模拟在线反馈,而无需交互成本。大量实验表明,与强基线相比,SOLAR-RL 显着提高了长期任务完成率和鲁棒性,为自主 GUI 导航提供了样本高效的解决方案。