论文

STAPO:面向LLM智能体训练的选择性轨迹感知策略优化

STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training

模型训练强化学习Agentic RL

摘要

强化学习是训练LLM智能体长程任务的主导范式。但稀疏延迟的奖励常导致轨迹忽视:智能体在中间步骤丢失对任务目标与交互历史的关注。既往工作用基于香农熵的不确定性信号做步级监督——它把固有状态复杂性与智能体置信混为一谈,因此对决策可靠性提供不可靠估计。为此我们提出归一化熵:度量置信相对智能体在给定状态下平均行为的偏离,强化低质动作与轨迹忽视的关联。基于此,我们提出选择性轨迹感知策略优化(STAPO):一个分层基于组的RL框架——用归一化熵定位与轨迹忽视相关的离群步骤,并经轨迹感知奖励与轨迹无关惩罚的联合机制优化它们,在保持训练稳定性的同时增强轨迹意识。ALFWorld、WebShop与搜索增强QA上的大量实验显示:STAPO取得最先进表现,同时大幅缓解轨迹忽视。

STAPO:面向LLM智能体训练的选择性轨迹感知策略优化:论文配图
图 1:香农熵和归一化熵在定位轨迹忽略方面的差异说明。