论文
Credit Where It Matters:终端智能体的依赖感知策略优化
Credit Where It Matters: Dependency-Aware Policy Optimization for Terminal Agents
摘要
使用终端的智能体从强化学习(RL)中受益于编码、调试及其他多步终端任务。这些任务中后面的命令常依赖前面命令产生的信息或中间结果。但既有轨迹级与步级信用分配方法并不显式追踪命令影响最终结果的读写依赖。因此训练信号仍可能被分配到无关操作,削弱从相关步骤的学习。本文提出依赖感知组策略优化(DepGPO):用命令间的执行依赖指导终端智能体的信用分配。具体地,从执行轨迹构建命令依赖图,从任务验证器检查的资源反向追踪;沿这些路径为相关写入及其支撑读取分配信用,并用其在步骤间重分配轨迹优势。大量对比实验与消融研究表明DepGPO改善复杂终端任务的任务性能与训练稳定性。