论文
经关键感知自反馈重试的智能体强化学习
Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry
摘要
大语言模型(LLM)智能体在长程交互任务中已展现强大决策能力——但仍难以有效利用失败轨迹:完全重试产生高交互成本——而经验检索倾向于稀释关键经验信号。为此——我们提出PivoARL——LLM智能体经验利用的自反馈重试框架。PivoARL经结构化反思识别关键错误轮次——仅从对应关键状态执行局部重试——从而复用正确前缀并减少冗余交互。从信息增益视角——我们进一步表明关键重试将有用经验信号集中在错误边界附近——缓解状态无关经验利用造成的信号稀释。基于该洞见——我们设计关键感知的信用分配机制——奖励正确前缀同时隔离错误后缀——并经隐式反思回报优化反思质量。我们在4个智能体任务与7个搜索式QA基准上开展系统评估。结果表明PivoARL在所有任务的Pass@2/3上取得显著改进——较MetaRL平均增益约11.5%。此外受益于关键轮次诱导的对比偏好信号——PivoARL还在80%以上任务上持续改进Pass@1。在扫雷环境中——PivoARL较GiGPO提升超45%——且较完全重试方法平均减少约42%交互轮次。代码见 https://github.com/yuki-younai/PivoARL。
