论文

语言模型智能体的具有稳定时间抽象的分层强化学习

Hierarchical Reinforcement Learning with Stable Temporal Abstraction for Language Model Agents

模型训练强化学习Agentic RL

摘要

分层强化学习通过围绕持久子目标组织原始动作并在多个时间尺度上分配信用来改善长期控制。最近的分层语言智能体通过明确地将子目标规划与操作执行分开,为交互式任务带来了这些好处。然而,我们观察到,显式层次结构本身并不能确定所得到的时间抽象的稳定性:学习的边界策略可能几乎每次都会替换子目标,使其有效地短暂,或者在子目标不再合适后保留子目标。我们称这种时间抽象不稳定。我们提出通过约束优化实现稳定时间抽象(STAC),这是一种约束边界策略优化方法,将过早的重新规划和陈旧的持久性表示为约束成本。 STAC 仅将产生的拉格朗日成本应用于采样的边界决策,使底层算法的奖励、批评目标、子目标优势和原始动作优势保持不变。在两个骨干模型和两个基准测试中,STAC 通过使用 Qwen3-0.6B 的 ALFWorld 和 WebShop 上的 $8.1$ 和 $7.9$ 点,以及使用 Llama-3.2-1B-Instruct 的 $23.5$ 和 $15.8$ 点,在强大的分层基线上提高了成功率。